更新:

ARC Prize 共同創辦人 François Chollet 回應 OpenAI 的測試結果時,區分了兩種測試設置。他表示,為了解決基準測試而「客製化」或「包含基準測試格式知識」的測試框架是不允許的。然而,未針對 ARC-AGI-3 開發且所有 API 使用者皆可使用的「通用 API 設定」則是公平的。

實際上,Chollet 承認 ARC Prize 自己對 OpenAI 的 GPT-5.6 Sol 評分可能讓 OpenAI 處於劣勢。他指出,ARC Prize 與 OpenAI 在「如何最佳測試其模型,特別是關於壓縮(compaction)方面」進行了多次來回討論,並樂見該公司「開始找出答案」。

Chollet 表示,不同供應商使用不同設定確實會造成「潛在的對等性問題」,但他認為只要「明確報告設定和成本」,這點是可以接受的。

原始文章:

OpenAI 表示其模型在 ARC-AGI-3 基準測試中仍能保持領先。在 Anthropic 的 Claude Opus 5 在這項邏輯基準測試中將紀錄分數翻了四倍之後,OpenAI 現在展示 GPT-5.6 Sol 透過兩種 API 設定,達到了 38.3% 的分數,超越了 Opus 5 的 30.2%。

然而,OpenAI 並未使用官方測試環境。相反地,它透過自己的 Responses API 運行 GPT-5.6 Sol,並使用了「保留推理」(Retained Reasoning)功能,該功能可在步驟之間保留模型的思維鏈,以及「壓縮」(Compaction)功能,該功能會摘要舊有上下文而非截斷它。

在官方測試框架中,GPT-5.6 Sol 的分數僅為 7.8%,因為模型在每次行動後其推理都會被捨棄。

OpenAI 認為,基準測試從來不只衡量模型本身,也衡量其周圍的技術設置。這確實是事實,而 ARC-AGI-3 的設計旨在測試純粹的模型效能。ARC Prize 在回應 OpenAI 的結果時表示,官方 ARC 分數採用標準化方法,不使用供應商特定的設定,以確保公平比較。

爭議點在於 ARC Prize 是否使用了較舊的「OpenAI 風格補全 API」,而該 API 缺乏 Claude API 已提供的功能,這將導致對 OpenAI 的比較不公平。