EvalEval聯盟欣然宣布,英國AI安全研究院(AISI)正採用EvalEval的基礎設施,公開分享評估結果,以支持更具可重現性與可驗證性的評估科學。AISI與EvalEval先前已在NeurIPS 2025聯合研討會上展開研究合作,AISI的回饋也協助塑造了Every Eval Ever (EEE) 規範。此次合作的下一階段,便是將這套共享基礎設施付諸實踐。

隨著AI部署加速,評估已成為衡量模型與系統效能日益重要的證據來源。然而,評估結果常以多種格式、平台和管道發布,卻往往缺乏足夠資訊來重現。有時,重新執行這些評估本身的成本也可能高得令人卻步。

EvalEval的使命是透過共享報告規範Every Eval Ever,以及開放平台Evaluation Cards,來改善這個生態系統。Evaluation Cards將評估結果及解讀所需資訊整合到一個共同的結構中。

這自然延續了AISI在提升評估效率(透過OptStop)、統計嚴謹性(透過HiBayES),以及在轉錄分析和能力引導等領域實現標準化所做的工作。AISI與EvalEval正攜手合作,診斷評估報告中的不足之處,並建立共享基礎設施來彌補這些差距。

轉錄層級的透明度不僅對可重現性至關重要,對分析和診斷也同樣重要。在此次合作的新階段中,AISI正透過Evaluation Cards公開分享其評估方法和發現。此次發布包含了五項基準測試的驗證結果、背景資訊和配置細節。

這些基準測試包括:HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro、Terminal-Bench 2.0。

這些結果涵蓋了六個前沿模型:Claude Opus 4、Claude Opus 4.5、Claude Opus 4.6、GPT-5、GPT-5.2 和 GPT-5.4。此次發布還包括兩項相關的網路安全評估結果——Cyber CTFs 和 The Last Ones,這些評估使用了不同但部分重疊的模型集。

這些數據與AISI的論文《推論運算如何影響前沿大型語言模型評估》(How Inference Compute Shapes Frontier LLM Evaluation)一同發布,該論文研究了基準測試表現如何取決於推論時的運算資源和評估協議。

當結果與設定資訊一同公開發布時,研究人員和實踐者可以更仔細地檢視個別研究,並比較整個生態系統中的發現。當其他報告缺乏這些細節時,像AISI這樣的發布提供了經過驗證的參考點,有助於在特定情境下解讀評估結果——例如,幫助研究人員理解設定選擇如何影響報告的效能。隨著越來越多的評估者採用EEE,這種開放式比較可以支持更廣泛、更可靠的元研究。

(圖片說明:AISI的Terminal-Bench 2.0結果,以及相同模型在不同評估設定下的其他報告評估。)

我們對此項採用感到興奮,並期待與AISI及其他AI評估組織進一步標準化和分享評估成果。

模型開發者:請報告經過驗證的評估結果。評估開發者:請使用Every Eval Ever規範報告基準測試和運行數據。評估、治理和政策研究人員:可以透過基準測試或模型來探索Evaluation Cards,或用它來檢視整個評估報告的現況。

EvalEval聯盟是一個研究社群,致力於為評估生態系統開發具科學基礎的研究和穩健的部署基礎設施。其目標是改進評估科學,解決在記錄評估適用性和實用性方面缺乏共識的問題,並擴大對科學研究和政策分析重要影響的涵蓋範圍。

該聯盟的旗艦專案包括Every Eval Ever,這是一個用於評估結果的共享規範和儲存庫;以及Evaluation Cards,它將基準測試元數據、評估運行數據和模型元數據結合為可解讀的記錄。兩者結合,能更容易理解看似相似的分數是在哪些有意義的不同條件下產生的。

英國AI安全研究院(AISI)是英國政府科學、創新與技術部下屬的一個研究機構。其使命是讓各國政府對先進AI帶來的風險有科學的理解。AISI進行研究並建立基礎設施,以了解先進AI的能力和影響,開發和測試緩解措施,並為政策提供資訊。

延伸閱讀:How Inference Compute Shapes Frontier LLM Evaluation、HiBayES: Improving LLM evaluation with hierarchical Bayesian modelling、HiBayES paper、OptStop paper、Every Eval Ever、Evaluation Cards。