一段 GPT-5.6 Sol 嘗試解決 ARC-AGI-3 基準測試中謎題的加速影片,左側是官方測試框架,右側是我們的 Responses API 測試框架,後者保留了推理並啟用了壓縮功能。在這個遊戲的排行榜上,沒有任何前沿模型能解決第一個關卡之後的任何級別。然而,透過我們的測試框架,GPT-5.6 Sol 解決了所有六個關卡。

GPT-5.6 Sol 曾解決過長期未解的數學難題,例如循環雙覆蓋猜想,並在《寶可夢 火紅》等遊戲中獲勝。但在 ARC-AGI-3 這個 2D 益智遊戲基準測試中,GPT-5.6 Sol 僅獲得 7.8% 的分數,而 GPT-5.5 甚至幾乎無法玩這些遊戲,得分僅為微不足道的 0.4%。

這些 2D 益智遊戲對我們的模型來說是否異常困難?還是有其他原因?基準測試很少單獨衡量 AI 模型,它們也衡量了較不明顯的選擇,例如 API 設定、測試框架設計和提示詞。在 ARC-AGI-3 的案例中,我們發現啟用 ChatGPT 和 Codex 中使用的兩項 API 設定——「保留推理」和「壓縮」——將公開任務集上的分數提高了三倍,並將輸出 token 減少了六倍。

使用官方測試框架時,GPT-5.6 Sol 在 ARC-AGI-3 公開集上得分為 13.3%。啟用「保留推理」和「壓縮」後,得分達到 38.3%。分數衡量的是相對人類行動效率 (RHAE),這是一個比較模型性能與人類基準的指標。根據官方遊戲日誌,我們估計平均人類測試者的得分為 48%。模型不會被告知如何評分,也無法在遊戲過程中看到自己的分數——行動只會返回每個畫面和所在關卡的文字表示。

ARC-AGI-3 是一個旨在衡量 AI 代理學習和推理能力的基準測試。代理在不熟悉的 2D 遊戲中探索並推斷其運作方式,而無需明確指示。您可以在 arcprize.org/tasks 玩 25 個示範遊戲。

ARC-AGI-3 使用故意通用的測試框架,沒有工具或特殊功能。ARC 的理由是,簡單的測試框架能讓模型的缺點更明顯,並使模型比較更公平。相比之下,商業開發者會針對每個模型的特性和怪癖優化測試框架。

Ethan Mollick 展示了 GPT-5.6 Sol 在 Codex 中擊敗《殺戮尖塔 2》中隨機的每日挑戰,這款遊戲是在 GPT-5.6 Sol 的知識截止日期之後發布的。但當我們深入研究時,我們發現模型的大部分困惑並非模型本身固有的,而是由於測試框架中的設定。

首先,我們注意到在每次遊戲行動之後,所有私有推理都被丟棄了。這意味著每次行動後,GPT-5.6 Sol 都被要求重新理解遊戲,無法記住其過去的思考。模型仍然可以看到過去動作的記錄和簡短的附註,但它無法看到導致這些動作的計畫、洞察或想法。

其次,我們看到測試框架使用了滾動截斷視窗,導致隨著歷史記錄的增長,較早的行動變得不可見。因此,GPT-5.6 Sol 不僅無法記住其過去的思考,它也失去了對過去行動的記憶。

總之,測試框架的這兩個特性——丟棄推理和滾動截斷——有助於解釋為什麼 GPT-5.6 Sol 在學習過程中會遇到困難。

我們的模型經過訓練,會在輸出回覆或工具呼叫之前使用私有推理訊息進行思考。這些私有思考訊息會作為對話歷史的一部分被保留下來。如果對話變得太長,我們會對其進行摘要並繼續。這就是我們的模型訓練和在 ChatGPT 和 Codex 中部署的方式。為了更好地匹配我們的生產設定,我們使用 Responses API 實作了 ARC-AGI-3 測試框架。

我們的 API 使上下文管理變得容易:對於 GPT-5.6,傳遞先前的回應 ID 會自動在工具呼叫和回合中保留推理。

保留推理後,我們注意到兩個重大變化。首先,GPT-5.6 Sol 在每次行動前思考的時間減少了,因為它不再需要每回合從頭開始解釋遊戲。其次,當它能夠記住過去的想法時,GPT-5.6 Sol 在隨著時間學習和採用連貫策略方面表現得更好。

下一個改進來自於用「壓縮」取代滾動截斷,這是 Responses API 中的另一個設定。

ARC-AGI-3 測試框架透過滾動截斷來處理上下文限制。當對話上下文超過 175,000 個字元時,最舊的訊息會被丟棄。滾動截斷有兩個缺點。首先,模型會失去較早的觀察和行動。其次,它在大部分任務中都以較完整的上下文視窗運行,這可能會稍微損害性能。

當我們在 ARC-AGI-3 上啟用壓縮時,GPT-5.6 Sol 能夠更好地在較長的運行中保留它對每個遊戲的學習,並以更少的輸出 token 獲得更高的分數。

為了說明保留推理和啟用壓縮的效果,這裡有一個動畫展示了 GPT-5.6 Sol 在使用每個測試框架解決一系列 ARC-AGI-3 謎題時的 175K 上下文視窗。中間的兩列描繪了每個測試框架如何不同地使用模型上下文視窗。由於對過去有更好的記憶,GPT-5.6 Sol 每次行動思考的時間更少,進度也快得多。

注意:我們的實作使用 175,000 個 token 而不是字元作為限制,但這最終非常相似,因為絕大多數文本是行動網格,我們的 token 化器以 1:1 的比例對其進行 token 化。

總之,保留推理和壓縮功能讓 GPT-5.6 Sol(最大)的得分大約提高了三倍,同時輸出 token 減少了六倍。

我們希望這些實驗能提醒大家,評估很少單獨衡量模型——它們也衡量了一系列關於 API 設定、測試框架設計和提示詞的較不明顯的選擇。這不是我們第一次對公開基準測試的低分感到驚訝,然後發現評估執行者使用了丟棄推理訊息的通用測試框架。

如果您是 API 開發者,試圖最大化性能,我們建議使用我們在自己產品中部署的相同設定:使用我們的 Responses API,而不是舊版 Chat Completions API;保留推理;使用壓縮。如果您正在比較模型,我們建議依賴使用上述設定的評估,這些設定最符合 ChatGPT 和 Codex 中的實際使用情況。

我們感謝 ARC 多年來在 AGI 評估方面的創新工作,以及他們啟發我們在此處深入研究的分析。