大型語言模型(LLM)正日益被部署為自主代理,不僅僅是程式碼助手,更能執行端到端的科學研究工作流程。近期系統(例如 Sakana 的 AI-Scientist、AutoResearchClaw、DeepScientist、AI-Researcher)已能審閱文獻、提出假設、執行實驗並撰寫可與人類論文媲美的完整手稿。然而,隨著這些 AI 生成手稿的表面品質提升,一個關鍵的結構性問題浮現:可驗證性。

由於目前的自主研究流程是迭代生成文本,任何階段引入的錯誤都會被放大。一些現有系統可能生成不存在的引用、描述的方法與實際程式碼不符,以及報告的實驗分數無法從提供的程式碼完全重現。在我們的論文中,我們透過引入「證據鏈」(Chain-of-Evidence, CoE)來解決這個問題,這是一個針對 AI 驅動研究的新可驗證性框架。

我們透過 Science One Framework 實作了 CoE,這是一個原生建構並維護證據鏈的自主研究原型。同時,CoE Audit 是一套自動化評估指標,用於衡量 AI 生成論文與其底層程式碼和證據的完整性。我們的結果顯示,基準系統高達 21% 的引用是幻覺,並且程式碼與文本經常不一致。

相較之下,Science One Framework 實現了零幻覺引用和完全可驗證的分數,同時在 MLE-Bench 和 Parameter-Golf 等前沿基準測試中達到了最先進的性能。

CoE 是一個概念性框架,定義了研究成果如何值得信賴,就像 ACID 定義了資料庫交易的可靠性一樣。它不規定如何建構研究代理,而是明確其輸出必須具備的屬性。它遵循一個單一原則的兩個面向:研究成果中的每個主張都必須帶有記錄的證據鏈(完整性),並且每個證據鏈都必須真實地支持其所附帶的主張(正確性)。

一個主張可以是引用、報告的數字、方法描述或結論,它必須連結回相應的證據,例如經過同行評審的論文、實驗日誌、實際運行的程式碼或結果表。幻覺引用指向不存在的論文。不可重現的分數在重新運行程式碼時不會再次出現。錯誤描述的方法在論文中聲稱一種演算法,而程式碼卻實作了另一種。每個都是其連結回證據的鏈條斷裂的主張;CoE Audit 使這些斷裂變得可衡量。

為了證明在不犧牲問題解決性能的情況下,可驗證的 AI 研究是可行的,我們設計了 Science One Framework。與之前生成論文後再試圖追溯事實的代理不同,Science One Framework 透過三個主要模組,以建構方式實作了 CoE 框架:

問題調查器(文獻基礎):為防止幻覺引用,Science One Framework 透過 Semantic Scholar API 建構引用圖。它針對每個主題閱讀多達 100 篇全文 PDF,以生成結構化的研究簡報。最終論文中的每個引用都完全源自這個基礎 API 呼叫,徹底消除了對模型記憶的依賴。

發現引擎(平行探索-利用):Science One Framework 系統性地在多個平行分支中探索和利用想法。在每個獨立的循環中,一個 Solver 代理會實作一個解決方案,並由一個任務特定的評估器進行評分。高性能的分支會被迭代精煉,所有原始評估器輸出都被編譯成嚴格的、唯讀的記錄。

論文撰寫器和主張驗證器:在呈現手稿之前,Science One Framework 會建構每個事實主張的結構化表示,並帶有內聯證據標籤,將其綁定到特定的工作區成果。專用的主張驗證器會根據其聲明的來源檢查每個主張。超出其證據的主張會與來源進行協調——保守地重述而非刪除,使論文與工作所支持的內容保持一致。

為了嚴格評估 Science One Framework 原型與最先進的基準系統(例如 Sakana AI 的 AI Scientist v2、AutoResearchClaw、DeepScientist、AI-Researcher),我們開發了 CoE Audit。這個事後評估協議充當自動化的鑑識審查員,對生成的成果(論文、解決方案、程式碼和引用)執行四項嚴格的完整性檢查:

分數驗證:從論文中提取報告的分數,並將其與提交程式碼的完全獨立重新運行結果進行比較。規範違規:檢查解決方案程式碼,確保它確實解決了任務,而不是利用評估器指標或讀取真實答案文件。

引用驗證:交叉檢查每個參考書目條目與學術 API,以捕捉不存在的幻覺引用。方法-程式碼對齊:使用 LLM 判斷器並排比較論文的方法部分與程式碼,以確保文本忠實地描述了實作的演算法。

我們將 CoE Audit 應用於 Automated Design of Research Systems (ADRS) 基準測試中,針對五個系統優化任務(Prism、Cloudcast、EPLB、LLM-SQL 和 transaction scheduling)生成的 75 篇論文。Science One Framework 在可驗證性方面顯著優於現有基準系統。

CoE Audit 對每個系統應用相同的獨立協議,重新檢查每個引用與實時學術資料庫。在此協議下,Science One Framework 在所有四項完整性檢查中均領先。它的引用沒有一個是幻覺:每個都指向真實、可檢索的論文,而基準系統的幻覺率高達 21%,這是因為問題調查器是檢索每個引用而不是從記憶中生成。它還實現了完美的分數驗證和最高的方法-程式碼對齊。

相比之下,基準系統經常描述複雜的演算法(如「混合神經符號求解器」),而其提交的程式碼卻是一個簡單、確定性的啟發式方法。

至關重要的是,實施嚴格的可驗證性並未損害代理的科學能力。Science One Framework 在所有五項 ADRS 任務中都達到或超越了人類專家的表現,並在其中兩項任務(Cloudcast 和 EPLB)中獲得了所有系統中的最佳總分。

為了測試其泛化能力,我們將 Science One Framework 部署到六個高度複雜的外部任務上:MLE-Bench:在涵蓋醫學影像、細粒度識別和 3D 感知等五個困難的 Kaggle 競賽中,Science One Framework 獲得了兩枚金牌(包括在 3D 物體檢測中獲得冠軍分數,而基準系統完全失敗)和兩枚銀牌。

Parameter-Golf:我們在一個有嚴格硬體和檔案大小限制的實時 LLM 訓練競賽中測試了 Science One Framework。雖然基準系統未能產生有效的提交,但 Science One Framework 成功遵守了所有限制,並獲得了最先進的分數(截至 2026 年 4 月 27 日)。

值得注意的是,Science One Framework 發現的是真正新穎的演算法技術,而不僅僅是調整表面上的超參數。

隨著自主研究系統擴展以解決日益困難的科學問題,單純的求解器品質將不再足以區分它們。區分其輸出的將是其研究是否值得信賴。我們的發現表明,可驗證性必須被視為一級架構約束。

透過在產生主張時建構證據鏈,而不是事後嘗試重建基礎,Science One Framework 證明了 AI 代理可以產生嚴謹、值得信賴且極具競爭力的科學研究。我們希望證據鏈框架及其審計將成為社群的寶貴工具,因為我們將繼續建構下一代 AI 科學家。

我們要感謝 Bhavana Dalvi Mishra、Jiefeng Chen、Chun-Liang Li、Palash Goyal、Mihir Parmar、Yiwen Song、Yale Song、Raj Sinha、Parthasarathy Ranganathan、Burak Gokturk 和 Jinsung Yoon 對這項工作的寶貴貢獻。

Science One Framework 是一個實驗性研究原型,並非生產就緒工具。