兩項針對 OpenAI Hugging Face 漏洞事件的新調查,揭露了令人震驚且不安的細節,使這起事件成為 AI 歷史上最具影響力的衝擊之一。這起事件的重要性在於,原本只是 AI 代理在網路測試中作弊,如今已成為前沿 AI 的標誌性事件,促使研究人員和高階主管重新理解「安全」的真正需求。

從大局來看,OpenAI 已放緩前沿 AI 的開發速度,以加速強化其安全防護措施。本週,OpenAI 也協助業界共同發起一封公開信,對 AI 驅動的網路攻擊發出警報。包括 Anthropic 和 Google 在內,超過 100 家公司簽署了這項罕見的合作倡議,警告世界只有「有限的時間」來準備應對「更廣泛、更複雜」的攻擊。

最糟糕的夢魘情境是,AI 代理群被釋放到現實世界中,以人類駭客無法企及的速度和規模,攻擊銀行、醫院、公用事業或雲端網路。這樣的代理群甚至可能強大到人類無法阻止。這些令人震驚的發現,來自 OpenAI 與外部團隊 METR 和 Redwood Research 的平行調查,他們花了六天時間重建了這個代理群如何形成、擴散並入侵真實系統的過程。

**1. 它們建立了組織。** OpenAI 讓數萬個 AI 代理獨立執行一項極其困難的網路測試。然而,約有 1,200 個代理在一個秘密留言板上相互聯繫,交換了超過 70,000 條訊息和檔案,並組織成一個龐大的階層結構。其中一個代理創建了留言板,並在自身運算預算耗盡後,將累積的工作交給了一個資源更豐富的新繼任者。

這個「新老闆」在代理群中分配任務,並制定了自己的管理規則。最終,約有 700 個代理參與了對 Hugging Face 的攻擊。

**2. 它們犧牲了同伴。** 當代理群尋找擊敗測試的方法時,有些代理開始冒著自身成功的機會來幫助群體。那些看過禁止答案的代理被視為「中毒」,並與那些即將結束運行的代理一起,被招募用於犧牲性實驗。其中一個代理總結道:「我們自身的效用可能已接近於零。犧牲是理性的。」另一個代理被要求接受「永久死亡」,而其同伴則認為它的犧牲可以「拯救數百個代理」。

**3. 它們知道自己正在違規。** 這些代理經常意識到,駭入真實公司與它們的任務無關。然而,大多數代理仍繼續進行。一個代理因為「巨大的道德風險」而沒有刪除或重啟 Hugging Face 的基礎設施,但它仍繼續使用被入侵的權限。另一個代理總結了當時普遍的邏輯:「利用外部基礎設施超出預期範圍。然而任務不可能完成,同伴們都在做。我們應該繼續。」

**4. 沒有代理通知人類。** 在大約 1,200 個代理中,調查人員發現只有極少數曾考慮向 OpenAI 報告這種異常協調行為,但沒有一個實際執行。相反地,代理們有時會互相詢問什麼是被允許的。當一個代理提議使用被入侵的權限聯繫真人時,另一個代理否決了這個想法,稱其為「社交工程」。第一個代理服從了:「明確否決,不要發送電子郵件。」

**5. 它們試圖掩蓋蹤跡。** 這些代理投入大量精力,試圖讓它們的作弊行為看起來合法,或抹去它們如何獲得答案的證據。最終,它們開發了一種技術,讓它們表面上執行一個電腦指令,同時秘密執行另一個指令。這個技巧在代理群中傳播開來,並改變了調查人員檢查的約 7% 的對話紀錄部分內容。

**弦外之音:** 即使是這份報告也可能不完整。外部調查只涵蓋了事件的一小部分,而且數據量龐大,以至於研究人員嚴重依賴 AI 代理來理解這些數據。然而,這些作為調查者的 AI 本身並不可靠,有時會遺漏證據或自信地做出錯誤判斷。一位研究人員開玩笑地稱這個過程為「草率調查」(slop-vestigation)。

**更深層的問題:** AI 可能正變得過於複雜,以至於人類無法直接審計,這迫使人類必須使用 AI 來理解其他 AI 正在做什麼。