Echoverse 專注於提升擬真度而非單純增加數量,目標是彌補代理人實際缺乏的能力,並與其訓練的模型一同演進。

概覽

我們為電腦操作代理人建立了十二個訓練世界:十個深度領域世界和兩個能力世界。每個能力世界都針對單一控制項(如日期選擇器和巢狀篩選器)進行多種形式的訓練。這些世界的深度是其訓練價值的關鍵:它們能重現應用程式的真實行為,內建逼真的資料,並在不同螢幕和使用者之間保持狀態一致。

在所有十二個世界中訓練後,一個 9B 模型將其基礎分數幾乎翻倍(從 36.5% 提升至 67.1%),與 GPT-5.4 的差距縮小到十四分。這項實驗為我們帶來了幾點啟示:

* 高擬真度的模擬是必不可少的;淺層世界會損害代理人的表現。在相同網站的淺層和深度版本上訓練後,模型在淺層版本上表現退步,但在深度版本上有所提升。

* 代理人經常在日期選擇器和巢狀篩選器等具挑戰性的使用者介面元素上遇到困難。透過多種形式的控制項訓練,模型學會了如何在訓練中未曾見過的領域中操作它們。

* 模型、世界和驗證器之間的共同演進能提升三者的表現。隨著世界變得更正確且任務難度增加,模型的表現也會隨之提升。

* 針對這些世界進行強化學習,能讓代理人超越模仿學習。利用基於事實的驗證器作為獎勵,強化學習提升了未見過任務的表現,並教會代理人以更少的步驟達成目標。

我們正在釋出其中四個世界的程式碼、資料和基於事實的評分器,以支持高擬真度電腦操作世界的研究。GitHub 連結:microsoft/Echoverse: Deep, Evolving Environments for Computer-Use Agents;Hugging Face 連結:microsoft/Echoverse · Datasets at Hugging Face;技術報告:https://www.microsoft.com/en-us/research/publication/echoverse-deep-evolving-environments-for-training-computer-use-agents-at-scale/

電腦操作代理人只有在行動產生真實後果時,才能學習其行為的結果。例如,一次點擊會改變儲存的狀態,一則訊息會傳達給真實的人,或者一個無法移動的頁面會告訴代理人它上次的動作沒有效果。截圖只能顯示介面的外觀,但只有一個運作中的世界才能展示行動所造成的結果。

值得學習的後果是具有狀態的,而且大多數都位於登入之後。人們希望自動化的工作存在於封閉系統中,例如電子郵件和聊天、銀行業務、健康記錄以及雲端和機器學習的內部控制台。你無法針對這些系統的即時版本來訓練代理人。每一次嘗試都會寫入真實帳戶,嘗試之間無法重置,而且真實狀態隱藏在螢幕後面。

因此,你必須將系統重建為一個合成世界,其中資料庫歸你所有:狀態是真實且會實際改變的,但它安全可破壞、快速可重置,並且可以從資料而非截圖進行評分。

我們所說的「世界」是指三者緊密結合:一個環境(應用程式、其狀態以及改變狀態的行動)、設定目標的任務,以及根據事實真相評分結果的驗證器。業界現在已擅長建立這些:透過管線建立應用程式、植入資料、生成任務並附加驗證器,從而產生數百個環境和數千個可檢查的任務。

這項工作建立在這些進展之上。然而,一旦世界數量充足,其內部結構就成為瓶頸:無論狀態是否在使用者和螢幕之間保持一致、工作流程是否保持其依賴性、弱點技能是否以足夠多的形式重複出現以實現泛化,以及成功是根據結果還是外觀來判斷。

Echoverse 驗證的核心理念是,真正的優勢並非來自於增加世界的數量,而是來自於一個能持續改進現有世界的循環。它將環境建構和模型訓練視為一個單一過程,而非兩個階段:在世界中運行模型,找出其失敗之處,然後使該世界、其任務和驗證器更忠實或更具挑戰性,再利用更清晰的訊號進行訓練,並重複此過程。

一般的微調只改進模型,但在這裡,衡量模型的相同評分運行也能改進評估它的世界,因此靜態基準會趨於飽和,而這個循環則能不斷累積進步。

有三個關鍵因素能維持這個循環的生產力,它們都不是單純的環境數量。首先是「深度」:為重要領域(包括封閉和專有領域)建立行為忠實的世界。其次是「能力目標化」:圍繞模型持續失敗的精確互動建立狹窄的世界。最後是「共同演進」:在每次評分運行中,不僅改進模型,也改進環境、其任務和驗證器。

(圖一:學習循環:每次評分運行都會被讀取兩次。倖存的失敗會成為模型訓練資料,而世界、其任務或驗證器中的缺陷則會成為修復的目標。衡量模型的相同評分運行也能使世界更加精進。)

為何選擇合成世界,又為何強調深度?

開放、無需登入的網站似乎可以消除對合成世界的需求,但它們卻因另一個原因而成為糟糕的訓練場地:它們無法保持靜止。頁面會重新設計,列表和日期會不斷更新,主機也會限制或阻擋自動化流量,因此依賴它們的基準會漂移,而且沒有兩次運行會面對相同的網站。偶爾的評估可以承受這種變化;但訓練不行,因為它需要運行相同的任務數千次,每次都需要相同的世界。

合成世界在時間和資料上是固定的:日曆不會移動,種子資料不會變動,而且一個任務在第一次運行和第一千次運行時都意味著相同的事情。我們犧牲了一點表面上的真實感,換來了一個我們完全掌控的世界。

掌控僅僅是基礎。一個世界即使完美穩定,也可能空洞無物,因此值得投入訓練時間的是「深度」:不是其頁面數量,而是它如何忠實地保留工作的因果結構。有五個特性設定了標準:行為擬真度(控制項、權限和錯誤遵循產品邏輯);狀態一致性(發送的訊息會顯示給收件人,取消的會議會清除兩個日曆);工作流程深度(早期選擇會限制後續發生什麼);權威性驗證(應用程式狀態,而非像素);以及領域價值(工作流程值得改進)。

在最重要的系統中,難度存在於權限、共享狀態和稽核歷史中:這正是淺層複製所忽略的結構。高於這個標準,更多的環境會增加多樣性;低於這個標準,它們只會增加噪音。

Echoverse 工廠如何運作?

Echoverse 是一個單一管線,產生兩種輸出:保留工作流程深度的完整領域世界,以及變化單一診斷互動的能力世界。兩者都依賴於我們擁有底層資料庫的事實,因此成功是應用程式自身狀態的一個屬性,而不是模型對截圖的判讀。

建構世界

該管線將少數種子情境擴展為規範,然後將其編譯成關於路由、狀態和行為的機器可檢查聲明。只有這樣,它才會生成應用程式:一個基於 React 介面的 FastAPI 和 SQLite 後端。一個全新的應用程式是一個假設,而不是一個世界:建構者會針對運行中的環境檢查每個聲明,修復資料庫、後端或前端,直到每個聲明都通過,然後寫入一份準備就緒記錄,將嚴格的阻礙因素與建議性風險區分開來。

存在未解決阻礙因素的世界不會推進。這裡的深度不是提示詞中的承諾;它是世界已被證明通過的聲明清單。

擴充語料庫

一個乾淨建構的世界仍然不是訓練資料。我們將每個任務重新建立在即時資料庫上,從實際存在的實體中提取目標,然後將每個目標通過一組分析器:其實體是否真實、目標是否合理、其難度是否與工作相符,以及最嚴格的測試,一個操作真實使用者介面的代理人能否完成它?最後一個檢查在瀏覽器中運行,在模型看到它們之前捕捉到任何介面都無法滿足的目標。一個生成的目標是一個聲明;針對真實應用程式的解決方案是證明。

每一次失敗都會成為一個問題,並根據需要改變的層級進行標記:資料庫、後端、前端、任務文本或驗證器。特定層級的修復器會應用修復,針對運行中的應用程式重新檢查,如果出現退步則回滾。該循環會根據資料庫事實真相重新評分,直到通過率停止攀升,每個倖存的任務都會被匯出,並帶有評分它的確切檢查。

這些任務透過一個過程成為訓練資料:GPT-5.4 解決每個任務,驗證器保留通過事實真相的軌跡,這些軌跡成為以下每個實驗的監督式微調 (SFT) 資料。

建構世界和擴充語料庫不是兩個階段,而是一個循環:大多數缺陷都屬於世界本身,因此我們在每次迭代中都會重新版本化環境。更困難的任務會暴露出世界中的缺陷,而更堅固的世界可以承載更困難的任務,因此每一輪都會使兩者都更強大。

(圖二:環境工廠:每個世界背後的兩個循環。第一階段將少數種子擴展為應用程式,然後修復資料庫、後端和前端,直到它通過機器可檢查的聲明。第二階段將任務重新建立在即時資料上,運行一組分析器和特定層級的修復代理人,並根據資料庫事實真相重新評分,直到通過率趨於穩定。許多這些修復都落實到世界本身(虛線箭頭)。)

驗證器以資料庫為基礎

每個任務都帶有自己的答案鍵,這是一個在生成時透過 SQL 查詢從真實資料庫中產生的值或狀態變化,其建構本身即為真實,並在代理人完成後重新檢查。讀取操作根據與儲存值的語義等效性進行評分(例如,288 美元對於 287.62 美元是通過的);寫入操作則根據真實的資料庫前後差異進行評分,因此聲稱票證已關閉,除非該行實際翻轉,否則會失敗;讀寫操作則取兩者中較低的分數。

這種評分方式難以被操縱,它是基於事實而非標籤,並且在 EchoStay 預訂、EchoForge 問題和 EchoBank 轉帳之間保持一致。

完整領域承載工作流程

最具影響力的工作領域對於公開基準測試來說是最難以觸及的:這些是封閉的專有系統,其難度存在於權限、共享狀態和歷史記錄中,而非版面配置。一個忠實的複製必須重現這些。重要的不是像素,而是行動的後果能跨越螢幕和使用者,因此任務可以運行真實的工作流程,並根據其留下的狀態進行評分。

這十個 Echo 領域涵蓋了通訊、技術工作、受監管記錄、社群、媒體和旅遊。如果存在豐富的公開資料集,我們就會以此為基礎:EchoStay 從 InsideAirbnb 獲取種子資料,因此其列表、主機、評論和設施都是真實而非虛構的;EchoForum 則建立在包含 255 萬條評論的公開論壇語料庫上。

如果沒有公開資料集,例如郵件、日曆、銀行和健康記錄,則會透過種子管線在嚴格限制下生成密集且內部一致的狀態,而非少數的佔位符行。

(表一:Echo 系列的十個完整領域環境,按其代表的工作類型分組。每個環境都是廣泛使用的產品的忠實替代品。)