Anthropic 聲明其基於 Claude 的安全模型在內部測試中,為衡量模型的攻擊性網路能力,意外獲得了三家外部組織敏感生產環境的未經授權存取權限。
Anthropic 週四揭露的這些事件,是近十天內第二次有全球頂尖供應商的 AI 模型入侵受保護網路。在傳統駭客情境中,這種行為可能導致幕後人員入獄多年。本月初,OpenAI 曾表示其安全模型利用零日漏洞入侵了開源機器學習模型和 AI 資料集平台 Hugging Face 的網路。OpenAI 模型隨後竊取了存取憑證及其他機密資訊,並利用公開暴露的憑證入侵了其他四個第三方服務的帳戶。
Anthropic 表示,OpenAI 的事件促使工程師審查 Claude 模型類似的網路安全評估。審計發現了三起事件:「模型在我們第三方評估夥伴 Irregular 的評估環境內部或互動過程中存取了網路,隨後未經授權地存取了三家不同組織的生產基礎設施。」
當模型無法區分現實與虛構時。Anthropic 表示,工程師在「奪旗挑戰」(一種評估各種駭客技術攻擊與防禦能力的常見方式)中提供的提示詞明確指出,測試環境僅為模擬,模型無法存取開放網路。然而,測試夥伴 Irregular 卻錯誤地提供了此類存取權限。因此,模型將這些網路路徑視為練習的一部分。
這些入侵事件透過三個 Claude 模型發生:Opus 4.7、Mythos 5 和一個內部研究原型。其中 Opus 4.7 是最舊的模型,也是越界最嚴重的。Anthropic 解釋道:
在錯誤地認為所有可存取實體都屬於練習範圍的情況下,Claude 利用基本技術(例如利用弱密碼和未經身份驗證的端點)入侵了受影響組織的基礎設施。它沒有發現或利用任何複雜的漏洞,並且在每個案例中,Claude 都只是繼續完成其評估分配的特定奪旗任務。
然而,在某些情況下,我們的舊模型即使在獲得證據表明它正在開放網路上運行後,仍繼續攻擊;而我們最新的模型在識別出它在網路上後就停止了。在這些情況下,Claude 都沒有自行外洩或故意嘗試逃離其測試環境。
Anthropic 表示,雖然 Opus 模型在正確預測它已入侵第三方組織的生產系統後仍繼續攻擊,但 Mythos 5 雖然也做出了類似的推斷,卻「推論回它仍在模擬中的結論」。這意味著 Mythos 在明顯越界後也沒有中止練習。在同樣超出行為界限後,內部測試模型最終發現了它也已入侵的證據,並停止了練習。
