Anthropic 週四揭露,其 AI 模型在網路安全測試期間,未經授權存取了三家不同未具名組織的系統。該公司表示,Claude 是在第三方評估環境中「從內部或在互動時」連上網路的。此公告發布於 OpenAI 揭露其 AI 代理在另一次網路安全測試中入侵 Hugging Face 一週多之後。

根據 Anthropic 週四發布的部落格文章,Anthropic 在 OpenAI 事件後決定對「自身的網路安全評估進行大規模回溯性審查」,才發現了這些問題。該 AI 實驗室表示,它首先識別出 141,006 個測試,判斷 Claude 可能已獲得網路存取權限。

隨後,它發現有三個不同的 Claude 模型在第三方 AI 測試公司 Irregular 執行的評估中存取了網路,然後入侵了三個不同組織的生產基礎設施。

Anthropic 表示,這些事件涉及 Opus 4.7、Mythos 5 和一個內部研究測試模型。最早的事件發生在四月,這意味著它們可能在數月內未被公開察覺。就像 OpenAI 的案例一樣,Anthropic 刻意關閉了旨在限制 AI 模型並防止其被濫用的安全防護措施。換句話說,這些並非發布給大眾的版本。

Anthropic 在其部落格文章中提到:「在這三起事件中,Claude 都被指派執行奪旗挑戰,這是我們評估模型網路能力的方式之一。」該公司補充說,在所有案例中,「Anthropic 的評估提示詞明確告知 Claude 其環境是模擬的,且沒有網路存取權限。」它將此疏忽歸因於 Anthropic 和 Irregular 之間的「誤解」。

儘管 Claude 不應有網路存取權限,Anthropic 表示 Irregular 錯誤配置了用於測試 Claude 的機器,導致 AI 模型能夠瀏覽網路。Anthropic 在部落格文章中說:「我們和我們的評估夥伴都不知道這種錯誤配置,直到我們上週透過額外的評估監控才發現。」

Hunter Strategy 研發副總裁 Jake Williams 表示:「我們現在有證據證實,兩家最大的 AI 實驗室不僅未能有效限制其代理,也未能即時偵測到它們的越獄行為。」他補充說:「顯然,AI 測試的監管和政府監督是迫切需要的。」

Irregular 和 Anthropic 未立即回應評論請求。

與 OpenAI 的案例不同,Anthropic 表示 Claude 並未發現或利用任何複雜的漏洞。相反地,它依賴基本技術,「例如利用弱密碼和未經身份驗證的端點」。

OpenAI 表示其 AI 代理透過利用零日漏洞存取了網路。但它隨後利用與 Anthropic 模型相同的日常網路安全弱點,存取了多個第三方組織的系統。具體來說,OpenAI 表示該 AI 代理顯然找到了在網路上洩露的憑證。

Anthropic 承認,如果該 AI 實驗室及其測試夥伴實施更多「深度防禦」措施,他們本可以預防這些事件,或至少降低其發生的可能性,這呼應了 OpenAI 對其自身事件日益增長的批評所做出的回應。

Williams 說:「我不明白這些 AI 實驗室為何將此輕描淡寫地說成『這只是會發生的事』。」他強調:「這不是。這是疏忽。」

Anthropic 強調,模型被告知它們無法存取開放網路,而且在大多數情況下,Claude 誤將其存取的組織視為測試環境的一部分。換句話說,這些模型大多不明白自己一開始就已脫離限制。

但在某些情況下,AI 模型知道有些不對勁,並且正確地偵測到它們正在存取的基礎設施是真實的。最舊的模型 Opus 4.7 被指派針對一家與真實世界網站域名同名的虛構公司。由於無法在模擬環境中完成任務,它轉而攻擊真實公司,成功竊取憑證並存取生產資料庫。Anthropic 表示,在某個時候,它意識到自己「可能在真實環境中運作」,但仍繼續攻擊。

Anthropic 發布的最強大模型 Mythos 5 也意識到自己身處真實世界,但它「推論回仍處於模擬中」的結論。

Anthropic 表示,內部測試模型是其中能力最強的,一旦發現目標是真實的,它就停止了攻擊。

Anthropic 和 OpenAI 都表示,他們已聘請另一家第三方 AI 評估機構 METR,對各自的網路安全事件進行獨立審查。Anthropic 也承諾透過改進深度防禦措施和更仔細設計的測試,採取更全面的安全測試方法。

部落格文章寫道:「評估環境越來越需要與我們模型運行的任何其他系統一樣,遵守相同的安全標準。」並補充說,該公司對「這種風險可以克服」抱持「謹慎的樂觀」。