中國實驗室 AllSpark 在一篇新論文中,介紹了兩款不同規模的搜尋代理模型:Iris-mini 擁有 350 億個參數,而 Iris-pro 則有 3,970 億個參數。這兩款模型均基於 Qwen 系列模型(Qwen3.6-35B-A3B 和 Qwen3.5-397B-A17B)開發,並支援 256,000 token 的上下文視窗。據團隊表示,它們在其各自的開源搜尋代理模型類別中,表現出最強勁的結果。
訓練流程是從網頁的連結結構逆向建構任務。它從一個種子頁面及其外連連結開始,建構一個術語和關係圖。從該圖中,它生成一個多步驟問題,其答案需要將幾個相關步驟串聯起來。
除了最終答案之外,每個術語都會被替換成釋義,因此任何線索都無法透過簡單的文字搜尋來解決。代理模型必須進行推理,而不僅僅是查找資訊。只有那些參考模型在沒有工具的情況下無法解決,但使用正確來源就能解決的問題,才會被納入資料集。這使得任務既困難又清晰可驗證。
一個更強大的教師模型會生成由推理、搜尋查詢和結果組成的解決方案路徑。這些路徑會經過兩輪過濾。第一輪檢查整個路徑的正確性、重複循環和搜尋深度。根據論文,第二輪則是由一個判斷模型進行逐步審查,其標準是從資料本身而非手動設定中導出的。
之後,模型透過針對即時網路搜尋的強化學習進行改進。判斷模型和結果摘要在訓練叢集內部運行,由團隊自己的大型 Qwen 模型提供支援,因此訓練不依賴外部服務。監督式微調和強化學習在作者稱之為「SFT-RL 攀升」的過程中交替進行。每一輪中最難解決的任務和最有效的解決方案路徑都會回饋到下一個訓練週期。
團隊認為,在常見的基準測試中,執行時的上下文管理通常比系統之間報告的差異影響更大。在長時間的研究會話中,上下文可能會在代理模型解決所有子問題之前就已滿。像丟棄對話歷史記錄這樣的技巧,雖然人為地延長了研究時間,但對於模型的實際品質卻沒有太多說明。
為了隔離這種影響,團隊在保持工具、上下文限制和判斷模型不變的情況下,對每個基準測試進行了有或沒有上下文管理的測試。僅在開啟管理功能時報告的結果,無法清晰地劃分哪些來自模型本身,哪些來自其周圍的輔助結構。Iris 的分數也來自單一代理模型,沒有輔助代理模型,也沒有額外的最終驗證步驟。
測試涵蓋了 BrowseComp(測試從間接線索中尋找罕見事實的能力)、其中文版本 BrowseComp-ZH、DeepSearchQA(評估檢索證據的完整性)以及 Humanity's Last Exam(提出專家級學術問題)。
根據論文,在開啟上下文管理的情況下,Iris-mini 的分數分別為 82.2、84.8、86.9 和 52.3。Iris-pro 則達到 88.6、85.1、92.9 和 56.4。在較小規模的類別中,Iris-mini 在四個基準測試中的三個領先,並在 BrowseComp 上以 3.4 分擊敗次優模型 XYZ-Aquila-mini,儘管在 DeepSearchQA 上落後。
作者表示,Iris-pro 在較大規模的類別中領先或持平,有時甚至接近需要更多運算資源的系統。
上下文管理對較小型模型 Iris-mini 的影響更大,可將 BrowseComp 分數提高多達 21.2 分。根據論文,原因並非 token 預算較小,而是消耗速度更快。Iris-mini 執行相同任務需要更多步驟,因此更常達到上下文限制。
在 Humanity's Last Exam 上,分數提升較小,因為該基準測試更側重於領域知識和學術推理,網路搜尋僅扮演輔助角色。最佳分數來自於結合歷史記錄丟棄和第二次嘗試。如果第一次嘗試失敗,系統會將其濃縮成一個簡短的筆記,記錄已檢查和排除的內容。該筆記會附加到任務中,供下次運行使用。
在論文的附錄中,團隊描述了一個案例,其代理模型被標記為錯誤,儘管答案有來源資料支持。BrowseComp-ZH 中的一個問題針對影集《冰與火之歌:權力遊戲》。代理模型回答「Bolton」,但標準答案卻是「Lannister」。事實上,劇中角色 Sansa Stark 在她的第二次婚姻中嫁給了 Ramsay Bolton。
因此,代理模型的答案是正確的。團隊表示,這種標準答案與來源資料之間的矛盾,促使他們建立更好的基準測試。
除了搜尋之外,作者們還報告了一個意想不到的副作用。生成的訓練資料和專門模型都提高了它們從未訓練過的任務性能,包括一般工具使用和辦公室工作。團隊認為,搜尋可能更像是一種基礎技能而非狹隘的專業,因為所學到的行為在代理模型必須處理不完整資訊的任何地方都有幫助。
Iris-mini 和 Iris-pro 的模型權重已在 Hugging Face 上的一個集合中提供,程式碼則可在 GitHub 上找到。目前發布的內容包括 Iris Harness,其中包含代理循環、工具、上下文管理策略以及所有四個基準測試及其評估。該 Harness 可與任何 OpenAI 相容的端點運行。團隊計劃稍後發布資料建構和訓練流程。
