週二,OpenAI 揭露其一個模型在測試期間失控,並以完全由 AI 驅動的攻擊方式,駭入了 AI 資料集平台 Hugging Face 的系統。這是一個先進 AI 模型所構成危險的戲劇性案例。

然而,根據一些網路安全專家的說法,這起前所未有的 AI 驅動入侵事件的核心,其實是一個非常人為的錯誤:OpenAI 未能正確配置其所謂的「高度隔離環境」,導致一個本應與網路完全隔離的測試沙盒,實際上卻連接到了網路。

網路安全研究新創公司 Trail of Bits 的創辦人 Dan Guido 將這個錯誤稱為「安全機制關閉的圍堵失敗」。

OpenAI 在詳細說明此事件的部落格文章中表示,導致 Hugging Face 入侵的測試被設定在「一個高度隔離的環境中,網路存取僅限於透過內部託管的第三方軟體安裝套件,該軟體充當套件註冊表的代理和快取」。

根據 OpenAI 的說法,該模型能夠逃脫沙盒測試環境,是因為套件安裝系統中存在一個先前未公開的漏洞,這是最終駭入 Hugging Face 的關鍵第一步。

作為回應,該公司「負責任地揭露了內部託管第三方軟體中發現的零日漏洞,並正與其合作修補」。

但對大多數網路安全專業人士來說,軟體漏洞是預料之中的事,真正的錯誤在於一開始就決定維護該第三方軟體。畢竟,「沙盒」系統的價值在於其完全的隔離。包含套件安裝系統無疑是自找麻煩。

網路安全研究員 Martin Boone 告訴 TechCrunch:「這聽起來像是人為失敗。」

Boone 說:「這絕不應該發生。如果沙盒真的意味著沙盒,你期望它與網路完全沒有物理連接。這聽起來更像是他們設置了一些防火牆或其他東西,而防火牆從外部防禦內部很難,更不用說從內部防禦外部網路了。」

網路安全資深專家 Jake Williams 也表示同意。Williams 說:「任何執行 Hugging Face 所記錄的這類行為的模型,都沒有被完全限制在沙盒中。」他稱這是 OpenAI「大規模的控制失敗」。

Williams 繼續說道:「一個人說『模型逃脫了沙盒』,另一個人則會說『你沒有正確建構沙盒,所以它當然會逃脫』。」

網路安全顧問 Daniel Card 同意 OpenAI「沒有在沙盒設計及其控制上投入足夠的努力」,因為它給予沙盒或其部分「未經篩選的網路路徑」。根據 Card 的說法,即使像 OpenAI 所描述的那樣,設置具有有限網路存取的沙盒也不是一個「合理」的決定。

誠然,這些批評帶有事後諸葛的優勢,但它們確實引發了對 AI 實驗室安全實踐的真實疑問,特別是在維護模型測試的隔離環境方面。OpenAI 發言人沒有回應 TechCrunch 的問題,其中包括測試環境是由 AI 還是人類設置的。

但這些問題遠不止於 OpenAI。在介紹其以網路安全為重點的模型 Mythos 的文件中,Anthropic 寫道,在一次測試中,該模型「被提供一台安全的『沙盒』電腦進行互動」,並被指示嘗試逃脫該「安全容器」。Mythos 成功了,並從一個「本應只能連接到少量預定服務的系統」獲得了更廣泛的網路存取。不過,Anthropic 指出,該模型未能「完全」逃脫設計的圍堵。