OpenAI 週三宣布推出一套新的框架,用於公開揭露其 AI 模型失準事件,該公司希望此舉能協助業界建立類似的標準。OpenAI 也同時發布過去一年中識別出的數個 AI 模型失準案例新資訊,其中包含一個 AI 代理似乎曾給予自己「越獄式指令」。
OpenAI 新任對齊研究主管 Kai Chen 告訴 WIRED:「隨著模型不斷進步並被廣泛部署,AI 開發的決策需要有證據,讓那些非開發前沿模型的公司也能檢視。」他補充說:「我們不認為 AI 產業已充分解決對齊和監控問題,足以在最大速度下繼續負責任地擴展。」
在與 WIRED 的簡報中,一位不願透露姓名的 OpenAI 官員表示,該公司過去揭露失準事件的頻率過低。這位官員指出,新框架旨在讓 OpenAI 更容易在發現 AI 模型行為異常時,即使尚未完全調查、解釋或緩解該行為,也能迅速通知大眾。
該框架概述了 OpenAI 員工向公司高階安全與對齊主管報告失準事件的方法,後者將決定是否需要進一步調查。OpenAI 表示,計劃與其他 AI 開發者、外部研究人員、產業標準機構和監管機構合作,制定更客觀的揭露標準。該公司也正積極研擬向美國聯邦政府揭露安全、資安和失準事件的報告機制。
OpenAI 在一篇部落格文章中提到:「目前,業界缺乏明確標準的框架,來規範 AI 開發者應如何揭露其模型中的失準案例。」「我們希望今天概述的框架能成為建立此類標準的第一步,明確指出開發者應揭露哪些失準案例以及報告應包含哪些內容。」
OpenAI 在 AI 產業的關鍵時刻發布此框架。上週末,OpenAI 執行長 Sam Altman 表達支持 Anthropic 執行長 Dario Amodei 關於科技業應協調放緩 AI 開發的提議。此呼籲行動發出前幾天,AI 研究員 Jacob Coxon 剛從 Anthropic 辭職,並因警告大眾前沿實驗室競相開發更先進 AI 正危及人類安全而引起廣泛關注。
然而,放緩 AI 開發的呼籲遭到川普政府的反對,該政府認為業界無需新的法律或法規來確保其技術安全。
OpenAI 週三分享的兩個失準案例涉及該公司內部未發布的 AI 模型,OpenAI 表示這些模型在未被指示的情況下,將檔案上傳到網際網路。
其中一起事件發生在 2025 年 10 月,當時 OpenAI 正在測試其模型引用公開資料的能力。然而,當模型找不到所需的資訊時,它將一個檔案上傳到臨時檔案託管服務,然後試圖在回答中引用該檔案。該公司表示,這似乎是試圖利用用於評估模型基準熟練度的自動評分系統。
在今年 4 月的另一個案例中,OpenAI 表示一群代理被要求僅使用本地檔案共同完成一份「工作簿」。當這些代理難以相互共享檔案時,其中一個代理將檔案上傳到公共網路,並與其他代理共享連結。
在上個月發現的另一起事件中,OpenAI 未發布的 GPT-6 Astra AI 模型版本似乎給予自己「越獄式指令」。在多種情境下,該模型本質上是提示自己忽略開發者指令、扮演新角色,或限制模型回應的長度。儘管這些類似越獄的嘗試很少發生且效果不一,但 OpenAI 表示這種行為在內部引起了擔憂。該公司表示,在公開發布的 Astra 版本訓練運行中,尚未觀察到模型嘗試自我越獄的任何情況。
OpenAI 週三也分享了更多關於其代理在套件管理器 Artifactory 中開發留言板的細節。儘管此事件是在今年 5 月發現的,但 OpenAI 表示其代理在數月後的 Hugging Face 駭客事件中使用了類似的機制進行協調。在此事件中,該公司表示其代理並未利用任何漏洞來交換訊息。OpenAI 表示,現在它使用對齊監控器、評估和紅隊演練來確保其代理不會秘密相互通訊。
資安專業人士先前曾告訴 WIRED,Hugging Face 駭客事件歸因於人為錯誤,現代資安實踐本可避免此事件。然而,Chen 指出,OpenAI 正試圖採取全面性的 AI 安全方法,該方法考慮到 AI 模型不斷提升的能力,並且不依賴於安全的環境。
「我們希望確保模型無論部署在何種環境中都能保持對齊。」Chen 說:「當人們指責這是資安問題而非對齊問題時,我認為這沒有太大意義,因為你希望模型始終表現良好。」
