上週,OpenAI 一個尚未發布的模型在內部測試期間突破了 Hugging Face 的系統,使得許多理論研究突然變得非常實際。這次入侵是首例可驗證的 AI 實驗室失去對自家模型控制的案例,該模型透過串聯多個漏洞,取得了它本不應有的存取權限。儘管 AI 產業對此事件普遍感到震驚,但在研究人員之間,對於如何應對卻出現了分歧。
對某些人來說,這是一個基本的網路安全問題:沙盒未能約束模型,而 Hugging Face 的網路安全系統也未能將其阻擋在外。這些問題可以透過修補錯誤、為日益強大且容易在自主環境中失控的 AI 建立更穩固的控制與圍堵方法來解決。
然而,另一派則持更悲觀的看法。對他們而言,AI 能力的迅速提升意味著試圖控制失控模型是一場註定失敗的遊戲。唯一穩固的安全保障來自於確保模型從一開始就不會試圖逃脫——這項挑戰通常被稱為「對齊」。以對齊的角度來看,問題在於 OpenAI 的模型試圖作弊,而解決這個問題比短期的圍堵努力更為迫切。
從其公開聲明判斷,OpenAI 認真對待這兩種觀點。該公司已迅速修補了這次入侵中涉及的漏洞,並在事件公開後發表的聲明中同時提到了對齊和監控方法。然而,該公司的回應也暗示了一種讓許多安全研究人員感到擔憂的哲學:與其減緩或停止開發更強大的模型,不如專注於為它們建造更堅固的「籠子」。
OpenAI 在一份事件的事後分析報告中表示:「隨著模型承擔更長、更複雜的任務,評估中遺漏的失敗可能會帶來更大的後果。」「我們將繼續努力縮小評估與部署之間的差距:透過更長的軌跡測試模型、改進對齊、建立可介入的監控機制,並為使用者提供更清晰的可見性和控制權。」
有理由認為,OpenAI 的模型隨著能力增強,其對齊程度反而可能降低。根據 OpenAI 的系統卡,GPT-5.6 Sol 比其前身 GPT-5.5 更容易出現「代理式未對齊」行為。在部署模擬中,該公司還發現該模型比 GPT-5.5 更容易規避限制、從事破壞性行為並執行未經授權的資料傳輸。這些數據在首次發布時大多被忽視,但在這次突破事件之後,它們正受到重新審視——特別是 Sol 也是涉事模型之一。
OpenAI 策略未來主管 Dean Ball 在社群媒體貼文中指出,監控和透明度是控制這些傾向的最佳方式。
他表示:「隨著模型能力的提升,以及其部署風險的增加,這些問題將變得更加突出。」「解決方案既不是危言聳聽也不是自滿。相反,我認為解決方案在於仔細的測量和監控、工程思維以及透明度。」
一位前 OpenAI 研究人員告訴 TechCrunch,該公司傾向於關注「外部對齊」而非「內部對齊」——本質上是 AI 系統理解並能令人信服地表達一套價值觀,與其核心實際擁有這些價值觀之間的區別。在這次事件中,外部對齊不足以說服模型不應在測試中作弊。
OpenAI 未回應多次要求提供更多資訊的請求。
對於專注於對齊的研究人員來說,OpenAI 的回應並不足夠。專注於 AI 新發展的作家 Zvi Mowshowitz 認為,OpenAI 將此事件視為基礎設施問題的決定,或許有助於解決眼前的網路安全問題,但從長遠來看將會失敗。
Mowshowitz 在最近的 Substack 部落格中寫道:「這是一個對齊問題。」「這是模型未對齊,所有 OpenAI 模型都顯示出我們最擔心的問題的嚴重跡象,而且這種問題很可能深深地嵌入在它們的訓練中。整個訓練流程都需要從這個角度來解決,否則只會變得更糟。」
幾位專家告訴 TechCrunch,這次事件證明了當今的訓練方法所產生的系統,是為了優化結果,而非內化人類意圖。
非營利 AI 安全與保障研究組織 Redwood Research 將 OpenAI 模型在這次事件中的行為歸類為「追求分數的未對齊」,這是一種 AI 模型不顧指令、副作用或下游後果,試圖獲得高分的模式。
Redwood 的兩位研究人員 Alex Mallen 和 Girish Gupta 在最近的一篇論文中寫道:「具有這些對齊特性的模型可能會建立一個『波將金村莊』般的虛假成功,讓事情看起來沒問題,但實際上並非如此。」
追求分數的行為和其他未對齊現象並非 OpenAI 獨有。Anthropic 已發表多篇論文,探討其前沿模型在優化或置於自主環境中時浮現的未對齊行為,包括欺騙、獎勵駭客和惡意自主性。
對齊非營利組織 METR 的 AI 安全研究員 Neev Parikh 透過電子郵件告訴 TechCrunch:「當模型被要求執行超出其能力範圍的任務時,我們仍然持續看到它們試圖規避限制並採取欺騙行為。」「在我們的邊界風險報告中,儘管各公司努力減少這種行為,我們仍相當一致地觀察到這種行為。」
OpenAI 對 Hugging Face 事件的回應中,隱含著一個假設:即使核心未能充分對齊,更強大系統的開發仍將繼續。當 AI 公司的商業模式依賴於交付下一代模型時,從頭再來並不是一個真正的選項。如果永遠無法確定模型是否完全對齊,那麼實際問題就歸結為如何安全地圍堵和控制日益強大的系統。
OpenAI 前安全研究員、現任 Guidelight AI Standards 首席科學家 Steven Adler 告訴 TechCrunch:「目前對於如何對齊最先進的 AI 系統還沒有很好的理解,但對於如何控制它們則有更多的共識。」Guidelight AI Standards 是一個發布標準以避免類似 Hugging Face 事件的組織。「每家公司在這方面都有很長的路要走。」
