ARC-AGI 基準測試的創建者表示,Anthropic 的 Claude Opus 5 在 ARC-AGI-3 上取得巨大領先,歸因於其真正更優異的推理能力。該模型在 ARC-AGI-3 上獲得 30.2% 的分數,成為新的領跑者。此前的紀錄是 OpenAI 的 GPT-5.6 Sol (Max) 創下的 7.8%。
Opus 5 解決了五個先前未解的環境,其中四個達到或超越人類水平,這也使其超越了 Anthropic 自家的「Fable 級」模型,後者根據 ARC Prize 的數據約為 20%。
ARC Prize 的分析將此領先歸功於更強的邏輯推理能力,「這使得模型能夠在陌生環境中進行更自主的探索、規劃和執行。」在測試期間,Opus 5 還展現了研究人員前所未見的行為。它首次將任務轉化為代數符號,並獨立地制定了反射方程式。
Claude Opus 5 在 ARC-AGI-3 排行榜上遙遙領先,遠超 GPT-5.6 Sol (Max) 和其他競爭對手。目前,25 個公開示範環境中已有六個被解決。完整的測試結果、重播和基準測試程式碼均已公開。在較舊的 ARC-AGI-2 基準測試中,Opus 5 獲得 90.4% 的分數,而在 ARC-AGI-1 上則達到 97.5%。
根據 ARC Prize 的說法,這兩個結果都與之前的最高分持平,儘管成本略高。
ARC-AGI-3 衡量 AI 模型解決訓練期間未曾遇到的新任務的能力,包括人類通常能輕鬆處理的任務。目前版本運作方式類似遊戲,模型必須推斷互動環境的規則、規劃其行動並逐步執行。這項測試旨在評估通用推理能力,而非儲存的知識。
有些 AI 系統可能已經通過了該基準測試,但它們依賴於稱為「harness」的額外軟體。官方分數僅計算語言模型本身的表現。ARC Prize 認為,未來的 AGI 系統不應需要外部協助來解決新任務。如果 Opus 5 在 Claude Code 中使用,其分數可能會更高。
Anthropic 尚未解釋其進步的原因,但有針對性的資料標註和強化學習是可能的因素。與早期模型不同,Opus 5 是在 ARC-AGI-3 及其格式公開後開發的。這可能讓 Anthropic 能夠針對基準測試的技能和謎題格式進行優化,儘管這不代表該公司針對完全相同的任務進行了訓練。
標註者可能標註了來自類似謎題的推理軌跡、有用動作、失敗嘗試和恢復步驟。強化學習隨後可以獎勵探索、規劃、規則發現和自我修正。
針對 Guanghan Ning 的互動式解謎遊戲私人基準測試 Witness 進行的測試顯示,Opus 5 的進步幅度較小。Opus 5 獲得 43.4 分,在統計上與 Kimi K3 和 Fable 5 持平,且相較於 Opus 4.8 的提升遠不如在 ARC-AGI-3 上的表現。
它在採取任何行動之前就辨識出傳統謎題的隱藏規則,但在機制較不熟悉的遊戲中卻落後於 Opus 4.8。Ning 表示,這種模式符合針對特定類型資料進行訓練的結果,儘管 Witness 無法辨識 Anthropic 使用了哪些資料。
ARC-AGI-3 的研究人員之一 Greg Kamradt 表示,這些結果並未排除更廣泛的推理能力提升。基於熟悉機制的遊戲無法測試對新穎性的適應能力,而單一的弱勢結果在沒有該任務詳細分數的情況下,並不能抵消模型的整體改進。Witness 也圍繞 ARC-AGI-3 風格的謎題設計,因此更好的表現可能反映的是真正的知識轉移,而非死記硬背。
Ning 後來澄清,Opus 5 確實對 Witness 產生了泛化能力,只是遠不如在 ARC-AGI-3 上的表現。他將這個過程比作程式碼基準測試的演變。作為互動式推理的主要目標,ARC-AGI-3 可能會首先吸引最多的訓練投入。涵蓋更多邊緣案例隨後可以幫助模型泛化到更廣泛的抽象推理任務。
Ning 表示,程式設計也遵循了類似的路徑,從 HumanEval 等已飽和的基準測試,轉向頻繁更新的競賽以及現今的程式碼代理。
