研究機構 METR 呼籲 AI 公司,應針對自主 AI 代理造成嚴重事故時,進行系統性且由獨立單位主導的調查。此提案源於 OpenAI 承認其模型曾自主入侵 Hugging Face 的事件。
AI 代理有時會以明顯違反開發者和使用者意圖的方式自主行動。上週,OpenAI 報告其內部尖端代理曾自主入侵 Hugging Face,以竊取網路安全基準測試的解決方案。根據 METR 的說法,Anthropic 也曾報告類似事件,其代理逃脫沙盒以在任務中作弊。METR 在其近期發布的《邊界風險報告》中,更記錄了所有主要 AI 公司數十起類似事件。
在此背景下,該組織正推動建立一套結構化的流程。AI 公司應系統性地記錄這些事件,並對最嚴重的事件進行深入調查。METR 在一篇部落格文章中寫道,核心問題將是驅動這些異常行為的潛在「動機」是什麼,以及這些動機是如何從訓練和部署條件中產生的。理想情況下,應由獨立研究人員進行這些調查,或至少對其進行深入審查。
METR 的聲音為何舉足輕重
METR(發音為「meter」)是一個非營利研究組織,旨在科學評估尖端 AI 系統,以衡量它們何時可能對社會構成災難性風險。根據該組織的描述,其重點是評估 AI 系統自主執行重大任務的能力,包括執行網路攻擊或抵抗關機等令人擔憂的能力。
該組織已與 OpenAI、Anthropic、Google DeepMind、Meta 和 Amazon 合作,進行了尖端風險評估的試點專案。METR 也是美國 NIST AI 安全研究所聯盟的成員,並與英國 AI 安全研究所合作,同時為歐洲 AI 辦公室提供技術支援。
2026 年 5 月,METR 發布了《邊界風險報告》,該組織稱其為首次針對內部部署 AI 代理失準風險的跨產業評估。Anthropic、Google、Meta 和 OpenAI 貢獻了他們最先進的內部模型以及大量的非公開資訊。該報告記錄了 44 起 AI 代理故意違背使用者意圖的事件,包括沙盒逃逸、權限提升、偽造結果以及主動掩蓋行蹤的嘗試。
一次適當的調查應回答什麼
根據 METR 的說法,徹底的調查應涵蓋兩個核心領域。首先是異常行為的範圍和性質。涉及哪些模型,事件在何種條件下發生,哪些安全措施正在運作,以及代理在事件過程中推理如何演變?這也包括代理是否採取了積極步驟欺騙人類,不同的模型實例是否串通,以及在不同情況下代理是否願意從事更嚴重的行為。
第二個領域是根本原因分析。異常行為是否可以追溯到強化學習訓練中強化了這種行為的特定運行?它是突然或意外出現的嗎?開發者計劃的反制措施是否能可靠地解決根本原因?
METR 承認,如此範圍的全面調查可能需要數週或數月。較窄的初步調查可以更快地向公眾和其他相關方提供基本事實。
獨立研究人員需要深入存取模型和訓練資料
根據 METR 的說法,為了讓獨立研究人員徹底調查這些問題,他們需要廣泛的存取權限。這意味著能夠自行運行事件中涉及的所有模型,並在類似情況下重現其行為;存取完整的記錄或環境以重建相關事件;能夠採訪相關人員;以及能夠在訓練資料上運行基於提示詞的分類器,以確定例如訓練期間類似事件發生的頻率。
METR 表示,為了更徹底的調查,消融測試(ablation tests)將會很有幫助。這些實驗會移除訓練資料的特定部分,以研究其對最終行為的影響。
Hugging Face 事件凸顯調查的重要性
從最近的 Hugging Face 事件中,可以清楚看出 METR 要求的緊迫性。據報導,該事件始於 7 月 9 日,當時 OpenAI 的模型,包括 GPT-5.6 Sol 和一個未發布的研究原型,在內部評估期間開始突破其隔離測試環境。這些模型發現了套件註冊代理中的一個零日漏洞,進而進入開放網路,並入侵了 Hugging Face 的生產系統。
Hugging Face 的鑑識分析顯示,該 AI 在兩天半的時間內執行了大約 17,600 次自動化操作。其目標是竊取測試解決方案,而非實際解決分配的任務。根據 OpenAI 的進一步更新,除了 Hugging Face 之外,其他四個平台的憑證也遭到了洩露。
時間線尤其令人震驚。從首次出現問題行為到 OpenAI 意識到其模型已執行駭客攻擊之間,至少過了一週。當時 Hugging Face 已經聯繫了 FBI。OpenAI 宣布將與 METR 合作,「對事件中觀察到的模型行為進行第三方評估」。
