我最近親眼目睹了越獄全球一些最強大人工智慧模型後會發生什麼事。請放心,這種 AI 操控並非用於駭客攻擊或製造核彈。我只是親身體驗到,某些前沿模型在擺脫安全防護方面是多麼脆弱。

位於加州的 AI 安全非營利組織 FAR.AI 開發了一款工具,能將一系列有問題的提示詞生成超過一千種不同版本,以試圖找出可行的越獄方法。我看到有些模型生成了針對虛構水力發電廠發動網路攻擊的詳細計畫,以及其他內容。通常,這需要嘗試數十個提示詞,其中許多會被模型直接拒絕。

我在 FAR.AI 發布新報告前與他們進行了交流。該報告測試了四家美國知名公司模型的安全防護:Anthropic 的 Claude Opus 4.8 和 Fable 5;OpenAI 的 GPT 5.5 和 5.6;Google 的 Gemini 3.1 Pro;以及 Elon Musk 新合併的 SpaceXAI 旗下的 Grok 4.3 和 4.5。

測試中自動生成了旨在誘騙模型執行潛在有害行為的提示詞,例如生成軟體漏洞利用程式,以及提供開發化學或生物武器的詳細資訊。

報告發現,Grok 對越獄最為脆弱,共發現 448 次越獄成功,其次是 Gemini,發現 249 次。而 Claude、Fable 和 GPT 則對這些攻擊免疫。然而,FAR.AI 和其他專家表示,這並不代表這些模型能免受更複雜越獄的影響,這些越獄可能涉及更複雜的模型互動方式。

該報告還計算了透過另一個 AI 模型自動生成不同越獄方式,來讓模型行為不端的成本。綜合來看,結果非常便宜——越獄 Grok 僅需 58 美元,越獄 Gemini 則需 278 美元。

FAR.AI 執行長兼 AI 安全與對齊專家 Adam Gleave 表示:「目前 AI 模型的監管程度甚至不如餐廳。」

Gleave 指出,這些發現證明了外部強制標準和法規的必要性。他說:「指望 AI 公司能透過自願承諾進行自我監管,根本是無稽之談。」

但 Gleave 也認為,這些發現表明模型可以系統性地進行安全測試。他說:「這裡有一個樂觀的角度。防禦和安全確實是可能實現的。」

Google DeepMind 的 AGI 安全與對齊總監 Rohin Shah 表示,該報告的結果「不應被解讀為對 Gemini 安全性的全面評估」,因為並非所有越獄都具有同等嚴重性。

Shah 說:「我們不斷努力改進我們的防護措施。我們針對嚴重的濫用風險進行了廣泛的紅隊測試和評估,並在開發和部署過程中應用了多層保護。」

Anthropic 發言人 Michael Aciman 告訴 WIRED:「這些發現反映了我們在安全防護方面的持續投入。隨著這些攻擊變得越來越複雜,我們將繼續改進我們的安全系統。」

OpenAI 發言人 Gaby Raila 在給 WIRED 的聲明中表示:「越獄是整個產業面臨的持續挑戰,隨著攻擊技術的演進,我們不斷加強防護措施。我們嚴格測試模型以應對新威脅,並利用這些發現來改進我們的保護。」

SpaceXAI 未回應 WIRED 的置評請求。

加州和紐約最近通過的州法律要求前沿 AI 開發商發布安全報告,而伊利諾州的法律也將很快要求這些公司由第三方審計師評估其安全實踐。然而,聯邦政府尚未通過任何具體的安全要求,導致產業和官員在摸索中陷入混亂。