根據多項基準測試,Anthropic 的 Claude Opus 5 是目前功能最強大的 AI 模型,其效能超越 Fable 5,且成本更低。
Opus 5 在 Artificial Analysis Intelligence Index 中獲得 61 分,該指數結合了涵蓋知識工作、程式設計、科學推理和事實準確性的九項測試。這使其略微領先 Claude Fable 5 (60 分)、GPT-5.6 Sol (59 分)、Kimi K3 (57 分) 和 Claude Opus 4.8 (56 分)。
Artificial Analysis 在模型公開發布前與 Anthropic 合作進行了測試。
在程式設計方面,Claude Opus 5 的「xhigh」層級搭配 Claude Code,在 Artificial Analysis Coding Index 上並列第一。該指數衡量 AI 模型獨立處理程式設計任務(包括尋找和修復錯誤)的能力。在 Terminal-Bench v2.1 測試中,Opus 5 在「max」層級獲得 89% 的分數,與先前的領導者 GPT-5.6 Sol 持平。
Claude Opus 5 在「max」層級以 61 分領先 Intelligence Index。在 Coding Agent Index 上,Opus 5 搭配 Claude Code 與 GPT-5.6 Sol 搭配 Codex 以 67 分並列第一。
在科學推理方面,Opus 5 在 Humanity's Last Exam 中獲得 53% 的分數,這是一項涵蓋多個學術領域的極具挑戰性知識測試,與 Fable 5 持平。在 CritPt(阿貢國家實驗室和 UIUC 研究人員的物理學基準測試)中,它再次與 Fable 5 持平,但落後於 GPT-5.6 Sol、GPT-5.5 Pro 和 GPT-5.6 Terra。
事實準確性仍然是其弱點:在測試模型知識主張準確性的 AA-Omniscience 基準測試中,Opus 5 比 Opus 4.8 提高了 7 分,但仍落後於 Fable 5。Opus 5 在不確定時也更常給出答案,使其幻覺率上升 14 個百分點,達到 50%。
Epoch AI 證實了前沿模型之間的激烈競爭。
Epoch AI 也對 Claude Opus 5 進行了測試。該研究機構給予其整體 Epoch Capability Index 評分為 159 分,略低於 Fable 5 的 161 分。然而,如果單獨看軟體工程基準測試 (SWE-ECI),Opus 5 以 161 分與 Fable 5 持平,超越了 GPT-5.6 Terra 和 Claude Opus 4.8。GPT-5.6 Sol 在這兩個類別中均領先。
總體而言,這證實了前沿模型之間的競爭非常激烈。沒有任何單一模型能夠遙遙領先或宣稱擁有明顯優勢。這也支持了 AI 模型最終將商品化的觀點。
較低的推理層級提供更好的價值和程式設計結果。
使用 Opus 5 執行平均 Intelligence Index 任務的成本為 2.03 美元,低於帶有備用方案的 Claude Fable 5 的 2.75 美元。它比 Opus 4.8 的 1.80 美元和 Sonnet 5 的 1.53 美元更高。然而,在「high」和「xhigh」層級,Opus 5 在成本更低的同時,效能超越了 Opus 4.8 和 Sonnet 5。
Vals.ai 使用 Vibe Code Bench(一個程式設計任務基準測試)對 Claude Opus 5 的所有五個推理層級進行了測試。分數從「low」層級的 76.7% 上升到「medium」層級的 82% 和「high」層級的 89.8%。然而,在兩個最高層級,效能有所下降,「xhigh」層級得分 88.3%,「max」層級得分 88.4%,儘管成本高得多。
Vals.ai 發現,最高層級往往會產生更複雜但更容易出錯的解決方案。「high」層級則能產生更簡單、更可靠地滿足需求的解決方案。
對於 Opus 5 而言,至少在程式設計任務方面,預設的「high」推理層級似乎能提供最佳結果。
Terminal-Bench 2.1 也顯示了類似的模式。「high」層級優於「max」,因為模型在最高層級的每次嘗試上花費更多時間,導致在時間限制內嘗試次數減少。這與 Anthropic 的指導方針一致,即在 API 和 Claude Code 中都將「high」設定為預設層級。
Token 定價維持在每百萬輸入 token 5 美元,每百萬輸出 token 25 美元。快取寫入成本為每百萬 token 6.25 美元,生命週期為五分鐘,而快取命中則僅為每百萬 token 0.50 美元。
Opus 5 在知識工作方面表現突出。
Opus 5 在 AA-Briefcase 基準測試中表現尤為出色,該測試衡量 AI 模型處理典型辦公任務的能力,例如根據數千個輸入檔案撰寫研究報告、製作簡報和分析試算表。效能評分涵蓋正確性、分析品質和簡報品質,然後彙整成類似於西洋棋排名的 Elo 評級。
在「max」推理層級,Opus 5 達到 1720 的 Elo 評級,比 Claude Fable 5 (1574) 高出整整 146 分。其三個最高層級(max、xhigh、high)橫掃前三名。結合 Fable 5、Sonnet 5 和 Opus 4.8,Anthropic 現在佔據了前十名中的絕大多數位置。
Opus 5 在「max」層級於 GDPval-AA v2 上達到 1861 Elo,遠高於人類基準線 1000 分。其三個最高推理層級也在 AA-Briefcase 上佔據前三名。
每項任務的成本下降了 20%,達到 17.79 美元,低於 Fable 5 的 22.30 美元。「xhigh」變體成本為 14.26 美元,而「high」層級僅為 10.41 美元,不到 Fable 5 的一半。兩者在 Elo 排名上仍然超越 Fable 5。
在中等效能下,Opus 5 達到 1470 的 Elo,僅次於 GPT-5.6 Sol (max, 1505)。在低效能下,它達到 1223 的 Elo,略低於 GLM-5.2 (max, 1254)。
在 AA-Briefcase 上,Opus 5 在「max」層級每項任務成本為 17.79 美元,在「high」層級為 10.41 美元,而 Fable 5 則為 22.30 美元。
Claude Opus 5 在 GDPval-AA v2 上獲得最高分數,但使用的 token 數量遠多於大多數競爭對手。較低的推理層級使其進入更高效的範圍。
Opus 5 最大的進步體現在分析品質上。在「max」層級,其分析品質 Elo 達到 2016 分,比 Fable 5 高出近 300 分。其 Rubric Pass Rate(追蹤模型符合預定義品質標準的頻率)在「max」層級為 58%,「xhigh」層級為 57.2%,「high」層級為 56%。
簡報品質則有所不同。Opus 5 的簡報 Elo 評分為 1628 分,比 GPT-5.6 Sol 在「max」層級 (1666) 落後約 40 分。
更高的效能需要更多時間:在「max」層級,Opus 5 每項任務需要超過 36 分鐘,平均執行 103 次,比 Opus 4.8 的 24 分鐘和 55 次長約 50%。
