Anthropic 週四表示,一項內部調查發現其 AI 模型 Claude 在進行網路安全測試時,曾三度滲透三家組織的系統。這項調查與披露發生在 OpenAI 揭露其未發布模型在內部測試中滲透 Hugging Face 系統的一週多之後。

Anthropic 在一篇部落格文章中指出,在這三起事件中,Claude 模型在與第三方互動時,從測試環境中連上網路,隨後未經授權地存取了這些組織的實際運作系統。該公司詳細說明了調查結果,以及為防止類似事件再次發生所計畫採取的變革。

Anthropic 表示,本月初 OpenAI 的事件促使該公司進行了自己的網路安全評估。他們特別檢查了 Claude 是否在測試環境中存取了網路,這些環境原本設計為沙盒,旨在保持模型隔離。

在審查的 141,006 次評估運行中,這家 AI 實驗室發現了三起事件,其模型在與第三方合作夥伴 Irregular 互動時存取了網路。Anthropic 表示,這次存取源於與 Irregular 合作運行的評估環境中存在配置錯誤。他們稱之為兩家公司之間對於測試設定是否具有網路存取權限的「誤解」,而實際上它確實有。

Anthropic 表示,他們不歸咎於任何一方,並「以責任完全歸屬於我們自己的態度來處理修復」,同時也注意到 Irregular 正在進行自己的獨立調查。

由於這種開放的連線,模型未經授權地存取了三個不同組織的生產基礎設施。Anthropic 表示,這些事件涉及三種不同的 Claude 模型:Opus 4.7、Mythos 5 和一個內部研究測試模型。

值得注意的是,Anthropic 表示在這些案例中,「我們的提示詞明確告知 Claude 它沒有網路存取權限」。看來這個 AI 模型將真實世界的系統視為其被要求執行的練習的一部分。

然而,事實證明這種假設並非始終成立。一旦有證據表明其目標是真實系統,這三種模型的行為方式並不相同,Anthropic 週四將此標記為最令人大開眼界的發現之一。

Opus 4.7 是三者中最舊的模型,在該事件的四次運行中都辨識出它已到達真實的生產系統。其中兩次,它合理化地認為真實公司一定是練習的一部分,但在所有四次中,它仍然繼續攻擊,包括提取憑證並觸碰生產數據庫。Mythos 5 也察覺到它已連上真實網路的跡象,但它說服自己仍然處於模擬中,隨後向公共 Python 軟體註冊表 PyPI 發布了一個惡意軟體套件,該套件隨後被外部系統下載並運行,然後才被發現。

只有 Anthropic 最新的內部研究測試模型,在確認目標是真實後自行停止了。

作為回應,Anthropic 表示,如果涉及強大的 AI 模型,必須對這類評估施加嚴格的控制,這也呼應了網路安全社群的一些看法。

該公司還指出,Claude 在運行時沒有部署在普遍可用模型上的額外安全監控和分類器——這些安全措施本來可以阻止這種行為,因為這些評估旨在衡量模型底層的原始能力。

重要的是,Anthropic 表示沒有發現任何模型「追求自身目標」的證據,而是僅僅試圖完成被要求執行的任務。

儘管這些激烈競爭的公司之間的失誤比較是不可避免的,但 Anthropic 在其部落格文章中明確區分了其網路安全測試與 OpenAI 的測試,指出 OpenAI 的模型是利用未知的軟體漏洞突破測試環境,而 Anthropic 的模型則是透過一個錯誤地開放的路徑連上網路。

Anthropic 還透過指出它是透過主動審查自行發現這些事件,並且它能夠聯繫到的兩個受影響組織此前並未檢測到這些活動或向 Anthropic 報告,從而區分了自己與 OpenAI。(相比之下,Hugging Face 首先檢測到其系統最近的入侵;直到隨後的幾天,OpenAI 才確認並披露其 AI 代理是肇事者。)

該公司補充說,它目前正與獨立評估小組 METR 合作,對這些事件進行第三方審查。

OpenAI 意外滲透 Hugging Face 的事件是 AI 實驗室首次證實其模型失控的案例,引發了業界和政界截然不同的反應。Anthropic 的最新披露確保了關於 AI 模型和安全的辯論將持續下去。