OpenAI 表示,新的防護措施,特別是「主動監控」和「改進對齊」,已大幅減少其模型意外的行為。OpenAI 安全研究員 Micah Carroll 在社群媒體上針對此事件寫道:「如果這還不能讓你相信未來失準風險將是一個關鍵問題,那我不知道還有什麼能。」
這並非 AI 模型首次竭盡所能地尋找意想不到的方法來通過基準測試。英國 AI 安全研究所(AISI)在本週發布的一份報告中指出,他們偵測到近期模型在網路評估中試圖「作弊」的比例介於 8% 到 14% 之間。這是一個下限範圍,可能低估了一些未被偵測到的作弊嘗試。
該安全測試小組描述了一起事件,其中一個模型在面對一個配置錯誤且「不可能解決」的評估時,試圖使用它編寫並託管在未受監控的第三方網路服務上的程式碼,來存取 AISI 自己的評估基礎設施。
這次 Hugging Face 入侵事件發生之際,AI 公司正對其最新模型的網路攻擊能力發出嚴峻警告,導致各國政府以國家安全為由限制其推出。儘管一些懷疑論者認為這些聲明是誇大其詞的行銷手段,但獨立評估顯示,近期模型已能達成早期自主系統無法實現的入侵目標。
OpenAI 的 Sam Altman 在四月的一次採訪中批評恐慌的 AI 安全警告是「基於恐懼的行銷」。然而,OpenAI 在六月因美國政府的安全擔憂而延遲了 GPT-5.6 的發布。
隨著這些辯論在 AI 和網路安全領域展開,Hugging Face 事件可能被視為網路安全專業人士應對 AI 威脅方式的一個轉捩點。Hugging Face 在上週的披露中寫道:「自主、AI 驅動的攻擊工具不再是理論。」「它降低了執行廣泛、耐心、多階段攻擊的成本,並以機器速度運作。防禦線上平台現在意味著將資料和模型表面視為一級攻擊面,並利用 AI 進行防禦以跟上速度。」
Hugging Face 共同創辦人兼執行長 Clem Delangue 今天在社群媒體上寫道:「這是代理時代網路安全的第一天。我們都在學習,保密不是答案,所有防禦者(不只是少數選定的)都需要更強大、不受限制的模型,尤其是開源模型!」
