Orchard 是一個開源框架,旨在為可擴展且具成本效益的代理式 AI 研究提供支援。其核心是 Orchard Env,一個可重複使用的環境服務,用於跨任務領域訓練和評估代理。
Orchard 的基礎設施支援軟體工程、網路導航和個人助理代理,並能直接在 Codex、OpenClaw 和 ZeroClaw 等真實部署工具中訓練它們,讓研究人員能跨任務重複使用環境、資料管線和評估工作流程。Orchard-SWE、Orchard-GUI 和 Orchard-Claw 證明,相對較小的開源模型也能在複雜的實際任務中取得優異成果。
例如,Orchard-SWE 在 SWE-bench Verified 上達到 69.7% 的成功率(若使用價值模型重排序則為 73.0%),僅使用約 30 億個活躍參數,已接近使用大十倍以上模型的頂尖系統。除了模型和工作流程,該專案還釋出了訓練資料和評估方法,旨在幫助廣泛的研究社群建立和研究開放的代理系統。
人工智慧正迅速從靜態問答轉向自主代理,這些代理能夠在複雜、多步驟的環境中進行規劃、推理和行動。這些系統可以修復複雜程式碼庫中的錯誤、代表使用者瀏覽網路,並管理涉及日曆和電子郵件的工作流程。
儘管代理式 AI 的能力令人興奮,但研究社群面臨著一個持續存在的瓶頸。建立最先進的代理系統通常需要專有基礎設施,包括客製化沙盒、封閉式訓練管線和專有資料集,這些是大多數研究人員和實踐者無法存取或重現的。
為了解決這個問題,我們推出了 Orchard,一個用於可擴展代理建模的開源框架。Orchard 的核心是 Orchard Env,一個輕量級的 Kubernetes 環境,提供可重複使用的隔離元件,用於大規模運行和建立代理,從收集訓練資料到強化學習試跑和評估。
與許多現有框架不同,Orchard Env 旨在無需修改即可支援不同的代理系統和任務類型。相同的服務可以跨領域支援軟體工程代理、網路瀏覽代理和個人助理代理。
為了展示這種方法,我們正在發布三個特定領域的訓練配方:Orchard-SWE、Orchard-GUI 和 Orchard-Claw。我們也同時發布了用於建立它們的訓練資料和評估方法。
Orchard 背後的核心理念是,運行時環境應該是一個獨立、可重複使用的服務,而不是嵌入在特定訓練框架內的基礎設施。Orchard Env 的 Kubernetes 基礎使其能夠並行建立、管理和移除數千個隔離元件。
該系統設計用於跨編碼、網路瀏覽和工具使用等任務。它還設計用於跨不同的代理系統,以及訓練和評估過程的各個階段,包括資料蒸餾和強化學習試跑。
這種靈活性使 Orchard 在研究規模上變得實用。團隊可以引入新的基準測試、代理系統或訓練演算法,而無需從頭重建底層基礎設施。
Orchard 還可以在任何工具中訓練代理。當今最強大的代理很少作為裸模型運行。它們透過複雜的工具(例如 Claude Code、Codex 和 OpenClaw)進行操作,這些工具管理多輪推理、工具使用以及與外部系統的連接。
開放訓練工具通常無法處理這些有狀態、多行程的工具,迫使研究人員在簡化的替代品上進行訓練,然後部署到實際環境中,這會產生不匹配。Orchard 彌合了這個差距:一個輕量級代理記錄工具自身的模型呼叫作為訓練資料,同時每個試跑都在自己的容器中運行,因此代理可以端到端地直接在將部署的工具中進行訓練——無論是 OpenClaw、Codex、ZeroClaw 還是其他工具——並且可以跨多個工具進行訓練。
軟體工程是自主代理最具挑戰性的應用場景之一。它需要對真實程式碼庫進行多步驟推理、工具使用以及從錯誤中恢復的能力。Orchard-SWE 是我們為此領域設計的訓練工作流程。它使用 Mini-SWE-Agent 框架構建,旨在自主解決軟體工程任務,並在廣泛使用的 SWE-bench Verified 基準上進行評估,該基準測試模型導航、診斷和修復真實世界程式碼庫的能力。
為了訓練該系統,我們從兩個先進的開源模型(MiniMax-M2.5 和 Qwen3.5-397B)中蒸餾了 107,000 次代理互動,涵蓋了廣泛的 GitHub Issues。訓練過程採用歸因監督式微調:系統不會丟棄代理未能完全解決問題的嘗試,而是從這些部分嘗試的有效部分中學習,從而擴展了模型可用的有用訓練資料量。
接下來是強化學習,但其回饋是稀疏的——代理通常只知道其最終修補程式是否通過或未能通過隱藏測試。我們從「平衡自適應試跑」(Balanced Adaptive Rollout)開始,它旨在充分利用這些不頻繁的成功訊號,然後添加兩種「密集獎勵」技術以提供更豐富的指導:一是「在策略蒸餾」(on-policy distillation),其中一個更強大的教師模型會逐步評分代理的決策;二是「過程獎勵模型」(process reward model),其中一個 AI 判斷會獎勵健全的問題解決過程——例如編寫重現錯誤的測試、驗證修復以及檢查現有行為是否仍然有效——而與最終測試是否通過無關。
最後,我們根據過去的試跑訓練一個價值模型,以重新排序候選解決方案。強化學習會產生許多通常會被丟棄的練習軌跡;相反地,來自 20 個先前實驗的軌跡訓練了一個緊湊的 40 億參數價值模型,該模型能夠識別高品質的解決方案,並在解決問題時對多個候選答案進行評分並選擇最佳的一個。
總體而言,這些技術使 Orchard-SWE 在 SWE-bench Verified 上的基準成功率從 61.4% 提升到使用平衡自適應試跑後的 69.1%,再到使用密集獎勵技術後的 69.7%——這在同等規模(約 30 億活躍參數)的開源模型中達到了新的最先進水平——若再結合價值模型重排序,則成功率可提升至 73%,接近大十倍以上的頂尖系統,如圖 1 所示。
網路導航帶來了另一組挑戰。代理必須解釋視覺佈局、與動態介面互動,並完成僅以自然語言描述的開放式任務。
Orchard-GUI 訓練了一個 40 億參數的視覺語言模型作為瀏覽器代理,僅使用了相對少量的監督:400 個蒸餾示範結合 2,200 個開放式訓練任務。儘管訓練資料有限,但由此產生的模型在多個網路導航基準上取得了優異成果:WebVoyager 上達到 74.1%、Online-Mind2Web 上達到 67.0%、DeepShop 上達到 64.0%,平均成功率為 68.4%,如圖 1 所示。
這些結果使 Orchard-GUI 成為迄今為止最強大的開源網路代理之一,同時與更大的專有模型保持競爭力。這些結果也表明,透過正確的訓練方法和環境,小型開源模型也能在實際網路任務中表現出色。
許多最具影響力的代理式應用涉及日常生產力任務,包括閱讀和撰寫電子郵件、管理日曆、搜尋資訊以及跨工具協調。Orchard-Claw 透過僅使用 200 個合成任務訓練代理,專注於個人助理任務。在涵蓋實際生產力工作流程的 Claw-Eval 基準上進行評估,它在最多三次嘗試下成功完成了 59.6% 的任務。當與更強大的 ZeroClaw 代理系統搭配使用時,成功率提高到 73.9%。
由於 Orchard 可以直接在真實部署工具中訓練代理,Orchard-Claw 是在多個工具中進行訓練的——包括 ReACT、ZeroClaw、OpenClaw 和 Codex——而不是單一的簡化迴圈。在這些真實工具中進行訓練顯著提高了代理的可靠性;例如,在 Codex 工具下,其成功率從未經訓練模型的 18.6% 上升到經過 Orchard 訓練後的 51.5%。
Orchard 的成果強化了一個更廣泛的觀點:環境層至關重要。透過使底層基礎設施開放、輕量且可重複使用,Orchard 降低了代理式 AI 研究的成本。團隊不再需要從頭開始建立客製化的隔離環境,或依賴專有雲端服務。相同的 Orchard Env 可以用於生成訓練資料、運行強化學習試跑和評估最終模型,而無需每次都重建系統。
展望未來,我們認為重複使用訓練經驗是實現累積式代理學習的一個有前景的方向。我們不再在訓練運行結束後丟棄軌跡,而是將它們視為持久資產——例如,將它們蒸餾成可重複使用的價值模型。這使得代理經驗能夠隨著時間累積,讓每一代新的代理都能繼承和擴展前一代所獲得的知識,而不是從頭開始。
Orchard-GUI 所展示的資料效率表明,大規模網路代理可以在不需要大量手動建立訓練資料的情況下進行訓練。透過釋出完整的 Orchard 堆疊,包括環境服務、訓練管線和訓練資料集,我們希望幫助廣泛的研究社群更快地建立更強大的開放代理。
我們感謝微軟研究院和合作機構的團隊對 Orchard 的貢獻,以及開源社群提供的基準和工具,使這項研究得以實現。
