微軟研究團隊近日在《Nature》期刊上發表了我們的逆合成模型 RetroChimera。
這篇論文詳細介紹了該模型的架構,以及廣泛的驗證研究,包括模型回憶稀有反應類型的能力,以及在專有資料集上成功的零樣本遷移和微調。
我們已將 RetroChimera 的實作程式碼和模型權重開源,希望能幫助研究人員加速開發與醫藥相關的新分子和先進材料。
開發新藥物和新材料需要製造新分子,但規劃其合成路徑仍主要依賴人工,耗時且成本高昂。RetroChimera 能自動提出高品質的合成路徑。該模型結合了兩個具有互補優勢的強大模型,並學習如何對其提案進行排序,以產生比單一模型更好的預測結果。在盲測中,博士級化學家們更偏好 RetroChimera 的單一反應預測,而非先前的模型或文獻記載的反應。
客製化分子正在推動現代醫學、智慧材料和永續農業的進步。然而,化學合成的進展卻因其耗時的特性而受阻,這是在實驗室中從更簡單的建構單元製造新分子的過程。此外,合成也是藥物開發成本的重要驅動因素。因此,即使計算方法使得探索大量新型分子成為可能,找到實用的合成方法仍然是一個關鍵挑戰。
逆合成透過從目標分子反向推導來解決這個問題,將其逐步分解為更簡單的前驅物(圖 1)。這個過程類似於玩策略性棋盤遊戲,如西洋棋和圍棋。它涉及考慮廣泛的可能立即步驟,或稱單一斷裂,同時也需要高層次的策略思維來達成端到端的合成計畫。然而,逆合成中可能的步驟數量遠多於棋盤遊戲,而且對於給定的分子來說,哪些步驟是可行的並不總是顯而易見。
現有系統面臨主要挑戰,包括回憶稀有但具戰略重要性的反應、訓練分佈之外的穩健性,以及與化學家期望的一致性。因此,逆合成通常需要高度專業的知識,這阻礙了科學發現的規模化和自動化。
在最近發表於《Nature》期刊的論文中,我們介紹了 RetroChimera,這是一個用於逆合成預測的新框架。它圍繞著兩個模型構建(圖 2)。R-SMILES 2 是一個基於 Transformer 的從頭(de-novo)模型,能直接從輸入分子預測前驅物分子。這賦予它直接從數據中學習反應模式的靈活性。然而,其不受限制的生成也可能使其容易產生幻覺。
相較之下,NeuralLoc 是一個基於圖神經網路(GNN)的模型,它將目標分子和反應模板編碼為圖。它選擇反應模板並預測它們應應用於目標分子的位置。其預測基於從訓練數據中提取的反應模式,因此它傾向於產生更準確和可靠的輸出。但當遇到模板庫未涵蓋的反應時,它會受到更多限制。
這些差異實際上卻成為一種優勢。這兩個模型並非做出相同類型的預測,而是捕捉化學中互補的模式,並專精於不同類型的反應。R-SMILES 2 在涉及反應過程中發生大變化的反應上表現特別出色,而 NeuralLoc 則擅長處理優先級較低以及涉及更局部變化的反應。
RetroChimera 透過學習到的集成策略,結合了兩個子模型的排序預測。每個模型都會為每個預測的反應物集合分配一個學習到的、依賴於排名的投票,當兩個模型提出相同的反應時,投票會被加總。透過學習在不同排名下對每個模型的信任程度,RetroChimera 可以利用它們的互補優勢,在大致上匹配所有反應類別中表現較好的子模型。
因此,RetroChimera 在常見和稀有反應類別中都表現出色,並產生了更符合化學家判斷的逆合成預測(圖 3)。在盲測中,專家化學家們更偏好 RetroChimera 提出的複雜分子斷裂方案,而非其組成子模型、更成熟的方法,甚至是測試集本身所提供的方案。
我們相信 RetroChimera 可以幫助研究人員更有效地識別有前景的合成路徑,從而支援分子科學應用中更快的設計、製造、測試循環,包括藥物發現和智慧材料設計。RetroChimera 可以讓化學家大規模評估更多且更複雜的候選分子。結合日益提升的實驗室自動化水平,我們預計將進一步加速實現合成規劃和執行的閉環、自我改進系統。
RetroChimera 已在 GitHub 上開源(MIT 授權),並可透過 Microsoft Foundry 存取。有關如何存取檢查點的說明,請參考 GitHub 儲存庫。
我們邀請廣大的化學界社群試用 RetroChimera,幫助我們找出其優點和不足之處,以便未來改進。我們期待聽到它在您關心的各種目標上的表現!
如需更深入了解研究結果,包括與外部研究合作夥伴進行的評估實驗,請參閱完整的《Nature》期刊論文和相關的 Microsoft Source 文章。
