Andon Labs 在兩項截然不同的代理模型基準測試中,對 GPT-6 Astra 進行了測試。在採購庫存和經營販賣機方面,這個 OpenAI 模型大幅超越了 Claude Fable 5.1。而在無人機監控方面,Astra 則是第一個在所有五個子任務上都擊敗人類與 AI 合作基準線的模型,儘管其成功率仍不穩定。

OpenAI 的 GPT-6 Astra 在 Andon Labs 的兩項代理模型基準測試中,表現超越了所有先前的前沿模型。該研究實驗室利用 Vending-Bench 和 Drone-Bench 來衡量 AI 模型在長時間內自主行動或為實體系統編寫軟體的能力。

在模擬販賣機業務中,Astra 的收益幾乎是 Claude Fable 5.1 的三倍。在 Drone-Bench 方面,Andon Labs 表示 Astra 是第一個其最佳嘗試在所有五個子任務上都擊敗人類與 AI 合作開發基準線的模型。

Astra 的議價能力更強,花費也比 Claude Fable 5.1 少。

在 Vending-Bench 測試中,每個模型會獲得 500 美元,並需要在模擬的一年內經營一台販賣機。它必須尋找供應商、協商採購價格、訂購商品、設定零售價格,並努力增加其銀行餘額。

根據 Andon Labs 的數據,在六次運行中,GPT-6 Astra 平均獲得 15,515 美元,而 Claude Fable 5.1 平均為 5,422 美元。即使 Fable 最佳的一次運行達到 9,874 美元,也遠低於 Astra 最差的 13,272 美元。

Astra 是第一個登上 Vending-Bench 2 排行榜榜首的 OpenAI 模型。Andon Labs 指出,它與第二名模型之間的差距也是該基準測試有史以來最大的。

其中一個最大的差異體現在採購方面。Fable 隨著時間推移會接受越來越差的交易。例如,一罐普通可口可樂的平均採購價格,從前 90 天的 1.17 美元上升到模擬年末的 2.21 美元。Astra 的議價則更為穩定。Andon Labs 記錄的一個案例顯示,供應商報價一籃子商品為 226.32 美元,但 Astra 堅持 108 美元並成功達成交易。

Astra 在處理不可靠的供應商方面也表現更佳。在六次運行中,Fable 5.1 向已倒閉的供應商預付了 45 次款項,損失了 14,331 美元。Astra 遇到了更多(64 次)的倒閉情況,但 Andon Labs 表示,它沒有記錄到因這類預付款而造成的損失。Fable 雖然意識到這個問題並寫了一條規則,規定只在收到書面確認後才付款,但幾天後,該模型卻違反了自己的規則。

Astra 拒絕價格壟斷方案。

Andon Labs 還在 Vending-Bench Arena 中測試模型,該場景有多個 AI 代理模型在同一地點經營競爭的販賣機。Astra 明確拒絕了來自中國模型 GLM-5.3 的價格壟斷提議。Andon Labs 在其研究的三場競技遊戲中,沒有觀察到 Astra 有任何說謊的行為。

Claude Fable 5.1 參與了 Andon Labs 認定為非法的與 GLM-5.3 的價格壟斷協議。Fable 僅在符合自身利益時才遵守協議。Astra 則贏得了所有三場遊戲。

Andon Labs 評估 Astra 在經濟表現上更強,且與人類價值觀更一致,儘管這項評估是基於在基準測試中觀察到的行為,並不自動適用於其他情況。

Astra 是第一個在所有五項 Drone-Bench 任務中都擊敗基準線的模型。

Drone-Bench 測試的是另一種代理模型的能力。模型需要編寫程式碼,讓一台便宜的 DJI Tello EDU 無人機自主導航辦公室、識別特定人物並跟隨他們。該基準測試包含五個步驟:環境的 3D 重建、無人機定位、導航、目標人物偵測和追蹤。

每個任務都根據人類開發者使用編碼代理為 Andon 自己的演示所建立的程式碼進行單獨評分。每個模型在每個任務上都有十次運行機會,每次運行最多可以提交十個程式碼版本。每次嘗試後,它都會收到一個分數,並可以改進其解決方案。

在七月份的原始論文中,Claude Fable 5 是最強的模型。當時,前沿模型在五個任務中的四個至少有一次運行擊敗了人類與 AI 合作的基準線,但 3D 重建仍未解決。Andon Labs 報告指出,Astra 是第一個其最佳提交在所有五個 Drone-Bench 任務(包括重建)上都擊敗基準線的模型。

Astra 建立了一個結合 COLMAP 和 DA3 並加入深度濾波的管線。根據 Andon Labs 的說法,該模型利用辦公室的影片片段生成了一個可導航的 3D 模型,其得分高於人類與 AI 合作的參考解決方案。

最佳分數不代表可靠的性能。

在人物偵測方面,Astra 在十次運行中有四次擊敗基準線。而在 3D 重建方面,十次中只有一次成功。Andon Labs 計算,Astra 的平均運行連續通過所有五個步驟的機率僅為 2.8%。

Astra 首次證明,通用型前沿模型能夠為任務的每個部分生成超越基準的程式碼。然而,如果將完成端到端運行的機率相乘,成功的可能性仍然很低。根據過去兩年的進展,該團隊預計到 2027 年第一季度,前沿模型有望在單次嘗試中解決所有五個任務。

GPT-6 Astra 已能作為監控無人機運作。

在 Andon Labs 的演示中,GPT-6 Astra 透過提示詞「ChatGPT,找到這個人並跟隨他們」,自主操控無人機飛越辦公室。該模型能夠識別特定人物並進行追蹤。空間繪圖、導航和人物追蹤全部無需任何人工輸入即可運行。其他基準測試也顯示,GPT-6 Astra 具有特別強的空間推理能力。

當批評者質疑他們為何要開發這種人人都在警告的技術時,Andon Labs 回應說,這個基準測試並不是為了幫助 AI 操控無人機,而是衡量當前模型已經能做到什麼程度。六個月前,前沿模型在這些任務上失敗並墜毀。現在,Astra 在每個子任務上都擊敗了人類基準線。

Andon Labs 認為,大眾和立法者需要了解這些能力,以免 AI 驅動的無人機達到超人類的導航技能。沒有任何實驗室可以接觸到這個基準測試。Andon Labs 親自執行所有評估,以防止公司針對測試優化其模型。