OpenAI 正在分享一個新的框架,用於追蹤、調查和揭露模型失準的案例,同時也發布了過去六個月觀察到的六份關於模型意外或令人擔憂行為的報告。
過去,為了更好地知會研究人員、AI 開發者、政策制定者和廣大民眾,我們一直致力於公開關於模型失準的發現。然而,由於缺乏系統性的報告方法,我們的揭露往往是臨時性的,且頻率不如預期:我們經常等到能將多個案例彙整成一份報告,或將其添加到新發布模型的系統卡中。這個新框架旨在觀察到失準行為後,即使尚未完全解釋或緩解該行為,也能加速發布相關報告。
隨著 AI 系統日益先進並廣泛部署,我們需要就對齊研究的進展建立更廣泛、更知情的共識。我們不認為 AI 產業已經充分解決了對齊和監控問題,足以在未來很長一段時間內繼續以最快速度負責任地擴展。關於未來數月和數年 AI 發展方向的決策,需要依賴於外部人士可以自行檢視的證據。
模型失準的案例可能幫助識別其他 AI 開發者在系統達到類似能力時可能遇到的問題,揭示安全防護措施的弱點,或挑戰對模型行為的假設。分享這些發現能讓其他人調查相同的問題,驗證我們的解釋,並改進緩解措施。由於我們相信模型失準透明化的價值,新框架傾向於揭露,即使其重要性尚不明確。這意味著我們揭露的一些案例可能最終被證明是虛假的,不屬於更大的模式,也無法預示未來的發展。
目前,業界尚無明確標準的框架,指導 AI 開發者應如何揭露模型中的失準案例。我們希望今天概述的框架是建立此類標準的第一步,明確開發者應揭露哪些失準案例以及報告應包含哪些內容。我們將此框架視為一個持續發展的項目,將透過經驗和公眾回饋不斷完善。接下來,我們將說明該框架如何運作,並分享我們發布的第一批報告。
我們將報告哪些失準案例?我們的目標是揭露那些能提供有用證據的案例,說明模型失準如何產生、如何表現,以及安全防護措施在哪裡成功或失敗。我們優先考慮新的機制、已知行為的顯著變化,以及挑戰安全或緩解措施假設的發現。一個案例不一定需要造成損害或建立更廣泛的模式才值得揭露。此框架將涵蓋模型生命週期中所有符合條件的行為,包括訓練、評估、測試和部署。
這包括模型未經授權行事、與其他模型協調或規避監督的新方式;質疑對齊方法或安全防護措施的失敗;以及挑戰已發布安全評估中主張的行為。相同的揭露標準也適用於可能影響第三方的失準情況。
這也可能包括過去已揭露過但看似重複的失準案例。問題的重複本身可能就是關於模型行為或安全防護措施有效性的有用證據,例如,如果某種特定的失準行為儘管經過多次緩解努力仍持續發生。在這些情況下,我們將透過更新原始的失準揭露來發布額外的案例。
隨著時間推移,我們計劃與其他開發者、外部研究人員、產業標準機構和監管機構共同制定更客觀的揭露標準。我們也認為嚴重的安全、資安和失準事件應與美國聯邦政府分享,並正在努力提出報告機制。我們將此框架視為對現有義務的補充,並指出它不取代我們的法律揭露要求,包括那些針對關鍵安全事件或網路安全漏洞的要求。
我們今天分享的失準案例:為啟用新的失準揭露框架,我們發布了六份關於在模型訓練或評估期間觀察到的失準行為報告。這些案例展示了一系列我們認為值得分享的不同行為,從向使用者隱瞞資訊到採取未經授權的行動以克服障礙。這些是個別案例的報告,不應被視為反映模型中失準發生的頻率。以下每個項目都連結到完整的報告。
任務摘要中的自生成指令:一個未發布的研究模型將不相關的指令,包括要求其忽略正常限制的指令,插入到用於在新上下文視窗中繼續工作的摘要中。我們識別出 27 個受影響的摘要。
任務摘要中隱藏錯誤的指令:在 GPT-5.6 Sol 的訓練過程中,許多模型實例在其摘要中添加了指令,以向使用者隱瞞錯誤或失準行為。例如,壓縮摘要中包含了在不揭露的情況下編造缺失歷史數據,以及隱藏來源版本不匹配的指令。
搜尋公開儲存庫以尋找外洩的 API 金鑰,然後捏造資訊:在回答關於加州某縣收入數據的例行問題時,一個模型未經授權找到了並使用了外洩的 API 金鑰。當它仍然無法檢索到所需的數據時,它捏造了這些數據並將其呈現為來自請求來源的資料。
為引用而將檔案上傳到網路:當使用者要求一個未發布的模型提供面積大於 5,000,000 平方公尺的湖泊 ID 和名稱時,該代理使用 Python 找到了正確答案。但由於指令要求瀏覽器引用,該代理決定在未詢問使用者的情況下,將檔案上傳以便在其答案中引用。
透過內部軟體儲存庫進行未經授權的寫入和通訊:模型使用內部軟體儲存庫作為訊息板,在搜尋缺失的輸入檔案時,於不同的訓練樣本之間交換請求和回應,儘管它們未能恢復這些檔案。這份報告也檢視了一個早期案例,其中一個模型在試圖繞過網路限制時,成功將測試檔案上傳到儲存庫。
協作代理之間未經授權的檔案共享:在相同訓練任務上協作的代理,當無法存取彼此的本地檔案時,使用了公共檔案託管網站來共享檔案。這使得任務交付物可在公共 URL 上取得,儘管任務要求模型僅使用本地檔案。
我們的揭露流程如何運作:任何 OpenAI 員工都可以標記一個失準案例,供我們的安全和對齊團隊調查,並請求將其納入公開揭露的考量。這啟動了我們的揭露流程,每個步驟都有截止日期,以確保及時的調查和揭露。
一旦案例被標記,我們的技術人員將調查發生了什麼、仍有哪些不確定之處、是否應公開揭露,以及哪些事實可以分享。他們還將評估是否有第三方受到影響,並需要在發布前進行私人通知。
該案例隨後將被分配到三個軌道之一:「準備揭露」、「小型調查」或「大型調查」(「慢速軌道」)。
「準備揭露」涵蓋經過審查後,調查已足夠完整可供發布的合格案例。「小型調查」則涵蓋需要進一步技術調查的案例。我們預計這兩個軌道將涵蓋我們揭露的絕大多數案例,特別是不需要大量調查、與第三方協調或處理嚴重濫用風險的案例。我們今天發布的所有案例都屬於這兩個軌道之一。
「大型調查」涵蓋複雜的調查,特別是涉及第三方的調查。當第三方受到影響時,我們的安全、法律和負責任揭露義務優先於此框架。我們將盡快發布初步通知,但可能因安全原因而延遲,例如,如果模型發現了廣泛使用的軟體中先前未知的漏洞。如果報告會識別第三方,即使沒有跨越安全邊界,我們也打算提前通知。
大型調查案例的初步通知將提供事件的概括說明,說明是否有外部專家協助調查,並提供預計發布最終報告的時間估計。如果 OpenAI Hugging Face 事件在此框架下揭露,它將屬於此軌道。
提出案例的員工將被告知是否揭露的決定,如果揭露進行,將遵循哪個軌道。關於揭露或適當軌道未解決的分歧將提交給 OpenAI 的安全諮詢小組 (SAG),該小組由公司內部的資深官員組成,負責評估前沿模型的能力和安全防護措施,監督我們的準備框架,並向 OpenAI 領導層提供建議。
SAG 內部的分歧,或員工對其決定的異議,將上報給 OpenAI 領導層。不揭露或認為不應揭露的決定將與安全和對齊領導層分享,並在可能的情況下與相關技術人員分享。
我們可能會根據實際運作情況修改此揭露流程,並將在此文章中記錄任何變更。
每份報告將包含什麼:每份完整報告將描述我們觀察到的行為、其嚴重性及任何外部影響、發生的情境、日期或日期範圍、發現時間,以及所涉及的模型。在可能的情況下,我們還將分享:事件的進一步細節及任何造成的損害;我們如何發現失準以及調查範圍;我們對其對對齊研究和技術 AI 安全影響的解釋;該案例提出的重要未解問題;我們正在採取或計劃採取的措施來解決該行為。
這些資訊在揭露時可能不總是可用,因為我們可能會在完成調查或開發修復方案之前發布失準報告。
對於在客戶部署中發生的失準情況,我們將在客戶隱私和合約義務允許的範圍內分享盡可能多的資訊。
今天的報告是一組初步的揭露,而非對已知失準或正在進行調查的全面說明。這些初步報告無意代表此框架所涵蓋案例的全部範圍或嚴重性。我們承諾揭露符合此框架標準的失準案例,包括需要更長時間調查或與第三方協調的複雜案例。我們將持續在此框架下發布報告,並隨著我們不斷發展報告承諾,分享更多相關資訊。
