該系統將代理分為兩種角色:規劃代理使用強大的高階模型,遞迴地將目標分解為更小的任務;工作代理則使用更快、更便宜的模型來執行這些任務。最終形成一個隨著工作進展而調整的任務樹。
Cursor 表示,這種角色分工主要解決了上下文問題。單一代理必須遍歷整個任務樹,同時記住總體目標和當前任務,這解釋了為何代理在長時間工作中容易偏離。在 Cursor 的代理群體中,規劃者不編寫程式碼,而工作者不負責規劃。
Cursor 指出,代理群體的擴展性並非主要來自平行工作,而是透過在決策的規劃者和執行的工作者之間分割上下文來實現。
先前的 Cursor 瀏覽器代理群體在 Git 上每小時約能完成 1,000 次提交。它使用了工作代理、一個判斷代理和一個解決衝突的整合器。然而,該整合器最終造成的瓶頸比解決的還要多。
新的代理群體達到了每秒 1,000 次提交的速度,因此 Cursor 建立了自有的版本控制系統。這是因為以這種速度工作的代理會產生人類團隊從未遇到過的故障模式。
在 Cursor 稱之為「分裂腦設計」的情況下,兩個規劃者可能會在不知情的情況下,在不同地方建立相同的想法並以不同方式實作。當規劃者彼此知曉並透過競爭性編輯互相阻擋時,衝突會更難以管理。
Cursor 讓代理將決策記錄在共享的設計文件中。與決策相關的程式碼透過編譯時檢查的參考連結回該文件。
當發生合併衝突時,一個中立代理會介入解決。工作代理會標記臃腫的文件,讓外部代理將其拆分為更小的模組。由於代理在與人類協作的現有程式碼庫中學會不觸碰核心程式碼,Cursor 允許它們故意破壞某些部分。一個代理可以修補其指定區域之外的程式碼,編譯器會將這些變更傳遞到整個系統中。
Cursor 測試了多種審查方法。一個審查者收到工作代理的完整記錄,另一個只看到輸出,第三個只看到程式碼庫。沒有單一視角能捕捉所有問題,但結合不相關的視角可以提高可靠性。
Cursor 還測試了一種「現場指南」,這是一個由代理自行維護的知識資料夾,具有固定的行數限制。每個代理在啟動時都會收到其內容。由於模型權重是固定的,因此捕捉意外發現非常有價值,這樣後續的代理就可以利用這些捷徑。
Cursor 給予代理群體 835 頁的 SQLite 手冊,並要求它建立一個 Rust 實作。原始碼、測試套件、SQLite 二進位檔和網路存取都被限制。基準測試是 sqllogictest,這是一個包含數百萬個 SQL 查詢和已知答案的測試套件,代理群體並不知道它的存在。
測試了四種配置:GPT-5.5 單獨運行、Grok 4.5 單獨運行、Opus 4.8 作為規劃者搭配 Composer 2.5 作為工作者,以及 Fable 5 作為規劃者搭配 Composer 2.5 作為工作者。在所有配置中,新系統都擊敗了舊系統。四小時後,新系統的運行得分介於 73% 到 85% 之間,而舊系統則介於 11% 到 77% 之間。新系統的每個配置隨後都達到了 100%。
Grok 4.5 的運行結果顯示了舊系統落後的原因。舊的代理群體在兩小時內產生了 68,000 次提交,約是新系統的 70 倍。這些活動大部分都是無效工作。舊系統累積了超過 70,000 次合併衝突,而新系統在整個測試中都保持在 1,000 次以下。
舊版本的衝突率持續加速而非趨於平穩。
舊系統運行中最具爭議的文件記錄了來自 1,173 個代理的 7,771 次衝突,而新系統中只有 47 次。同樣的分裂腦問題也出現在套件結構中。舊系統將專案分解為 54 個 Rust crate 和三個獨立的 SQL 套件。新系統則早期就確定了九個 crate。
在 Fable 5 配置中,舊代理群體需要 64,305 行引擎程式碼,而新系統只需要 9,908 行。在 Opus 配置中,舊系統產生了 19,013 行程式碼並獲得 97% 的分數。新系統則以 4,645 行程式碼達到了 100%。
在相同或更好的測試分數下,新架構將程式碼庫大小減少了高達 85%。
工作模型造成了最大的成本差距。在 GPT-5.5 的運行中,僅工作代理就花費了 9,373 美元。而在使用 Opus 和 Composer 的運行中,整個工作代理群體在可比品質下僅花費 411 美元。這種差異幾乎完全歸因於定價。Composer 2.5 的基準測試表現與 Opus 4.7 和 GPT-5.5 相當,但每百萬輸入權杖僅需 0.50 美元,每百萬輸出權杖僅需 2.50 美元。
根據 Cursor 創辦人 Michael Truell 的說法,該模型基於 Kimi K2.5。
Cursor 認為,大型任務中只有少數部分需要高階模型的智慧,包括任務分解和關鍵設計決策。一旦高階規劃者解決了模糊性,更便宜的模型就可以遵循其計畫,儘管混合運行顯示規劃者的品質仍然很重要。Fable 5 規劃者使用的規劃權杖比 Opus 少,但其工作代理需要更多的權杖才能完成任務。因此,Fable 運行的總成本更高。
在每次運行中,工作代理至少使用了 69% 的權杖,但只佔了部分成本。
Cursor 將代理群體描述為一種機率編譯器,它能將意圖一步步轉化為可執行的工作。該公司表示,準確描述這種意圖是實驗中的主要限制。Cursor 已將 Opus 單獨運行的程式碼庫以 minisqlite 的名稱發布在 GitHub 上。
像這樣的運行不再僅限於實驗室。Fable 5 的預發布版本處理了 Bun 從 Zig 到 Rust 的大部分重寫工作。64 個實例在 11 天內編寫了超過一百萬行程式碼,花費約 165,000 美元。然而,實際生產中的應用情況仍有所不同。一項於 2025 年底發布的研究發現,68% 在生產中使用的代理在人類介入之前,完成的步驟不超過十步;對於 47% 的代理來說,限制甚至少於五步。
