前沿 AI 實驗室在安全地訓練、評估和部署模型方面肩負著巨大責任。第三方評估是平衡這項責任的關鍵環節,它能擴大對 AI 安全的意見參與機會,讓世界了解情況,並確保實驗室對其明確且獨立支持的安全主張負責。
作為我們引領前沿發展努力的一部分,OpenAI 致力於支持獨立評估,並提供在訓練、評估和部署各階段的深度存取權限。這種存取權應能讓評估者挑戰我們的假設,識別我們可能遺漏的風險,並就我們安全措施的有效性得出自己的結論。
長期以來,我們在模型開發和部署過程的各個階段都與第三方評估者合作。我們也將第三方評估納入我們的「準備框架」(Preparedness Framework)實踐中,並支持倡導更嚴謹和負責任流程的組織與立法。在這些合作中,我們提供了深度的存取形式,包括技術安全措施的資訊、可見的思維鏈(chain of thought)存取,以及前所未有的機密數據和內部部署存取權限,用於事件應變和監控紅隊演練。
這裡分享的優先事項和原則,主要著重於我們與私營和非營利部門的獨立評估組織在技術安全評估方面的合作。它們補充了我們與政府在測試和評估方面的工作,因為不同的角色和責任可能需要不同的方法。
要使這些評估有效,需要強大的獨立機制、科學嚴謹性、健全的安全實踐和明確的責任。實驗室有責任在保護敏感資訊的同時,實現有意義的審查。實驗室和獨立評估者共同承擔確保評估正確的責任,並應遵循共同的國際安全和資安實踐標準。下面,我們提出了四個優先評估領域,以及嚴謹、安全和獨立工作的原則。
第三方評估在解決具體且關鍵的問題時最為有用:證據是否支持實驗室的安全案例和安全主張?評估是否充分測試了其旨在衡量的風險?安全措施在實際條件下是否有效?
這裡描述的評估旨在根據所檢視的安全問題採取不同形式。我們預計將同時支持多項評估,並在不同時間段內進行,有些持續數週,有些則長達數月。雖然第三方評估也可以是部署前工作的一部分,並可能影響部署決策,但這裡描述的工作通常是長期且與發布無關的,重點在於隨著時間深入檢視特定的安全主張。
在我們的優先領域和原則中,我們提到了「安全主張」(safety claims)和「安全案例」(safety cases)。這些術語的含義如下:
我們提出了四個優先評估領域,以及嚴謹、安全和獨立工作的原則。
**1. 安全案例的獨立評估,涵蓋訓練、評估、內部部署和外部部署。**
安全案例的評估需要對對齊(alignment)、監控等控制方法、網路安全、生物和化學濫用以及紅隊演練等方面的專業知識。安全案例包含訓練、能力評估和安全措施等主張,可以整體或部分進行評估(參見下面的優先事項 2 和 3)。
多個評估者可能需要根據各自的專業知識,檢視案例的不同部分。他們的評估應共同回答以下問題:訓練、評估和部署的安全案例證據是否得到證實?在訓練、評估和部署過程中是否遵循了安全案例的條件?
我們的安全案例是否涵蓋了評估過程中發現的最緊急風險?安全主張是否支持整體安全案例?是否存在任何空白或需要改進的領域?是否使用了有效的方法來識別和減少訓練中可能獎勵欺騙、獎勵駭客行為、破壞性行動或規避限制的誘因?
**2. 關鍵安全措施的評估,涵蓋內部和外部部署。**
我們的安全措施堆疊(safeguard stack)不斷演進,以應對不斷變化的能力和環境。我們的安全措施涵蓋訓練、內部部署和外部部署。它們目前包括模型級安全措施、執行安全措施和資安安全措施,以及失準監控器,涵蓋了各種風險(例如失控,以及網路、生物和化學風險中的濫用)。
技術合作夥伴現在可以識別安全措施中的弱點,同時改進評估方法並加速標準制定,為未來引領前沿的公共政策提供更強大的技術基礎,特別是對於內部部署,其安全和資安標準仍處於萌芽階段。
獨立評估應檢視這些安全措施的運作情況以及可能不足之處,例如:使用「灰箱」(grey box)存取,安全措施是否能有效抵禦對抗性測試(越獄),並充分防止高風險領域(例如網路、生物)的能力提升?我們的對抗性測試和紅隊演練是否涵蓋了最重要的風險?
在實際操作條件下的授權測試中,代理(agents)如何與存取控制、沙盒和偵測與響應系統等網路防禦措施互動?哪些防禦措施可以預防、偵測或遏制有害行為,以及它們在哪裡失效?
我們的失準監控器是否存在任何可能導致失控或嚴重失準的關鍵漏洞,無論是內部還是外部部署?隨著模型能力的提升,思維鏈監控作為安全或對齊證據來源的可靠性如何?是否在所有相關的訓練、評估和部署中實施了適當的監控,並且不易被禁用?安全措施的實施是否與模型能力相稱?
**3. 能力評估的評估,涵蓋「準備框架」風險類別(化學和生物風險、網路安全、AI 自我改進)以及失準風險的對齊評估。**
我們的「準備框架」要求評估關鍵的前沿風險領域。隨著閾值被超越和評估飽和,持續更新並確保評估涵蓋範圍和品質至關重要,這些評估旨在衡量「準備框架」風險領域的能力,以及旨在評估嚴重失準風險的對齊評估。
相關問題包括:評估「準備框架」風險的評估是否充分涵蓋了「準備框架」風險閾值的定義?這些評估的閾值設定是否正確?
當模型持續獲得最高分時,評估是否會更新,並且新的測試是否能有意義地衡量更進階的能力?我們的對齊評估是否充分涵蓋了嚴重的失準風險,以及它們可能遺漏了哪些重要的行為或條件?
**4. 關鍵失準事件的獨立調查。**
獨立調查對於一系列關鍵的 AI 安全事件都具有價值。在這裡,我們專注於模型失準,包括模型未經授權行動或規避監督,即使沒有故意濫用,這也能揭示對齊方法和安全措施中的弱點。
在特定情況下,例如 OpenAI Hugging Face 事件,引入獨立第三方進行獨立失準事件調查可能是有益的。參與事件調查的第三方必須具備所需的調查專業知識,包括(如適用):網路鑑識專業知識、對齊專業知識、大規模思維鏈分析,以及及時進行調查所需的人員和資源。
事件應變可能涉及存取敏感的內部數據和第三方數據,因此某些細節可能對發布或存取敏感。獨立調查的結果也可以透過提供證據來評估模型對齊的主張以及補救先前觀察到的失準所採取的措施的有效性,從而為模型的安全案例提供資訊。
在失準事件的背景下,我們優先對以下方面進行獨立評估:事件過程中發生了哪些模型行為或失準問題,以及主要促成因素是什麼?安全措施和補救措施是否能有效減輕未來類似事件的發生?
**有效評估的原則**
**明確的範圍和雙方同意的評估主張:** 評估應從雙方同意的範圍開始,隨後是明確定義的安全主張,這些主張應在評估活動開始前預先註冊。第三方和實驗室應澄清這些主張是受評公司希望提出的評估主張,還是第三方評估者旨在獨立評估且實驗室同意接受評估的主張。
某些主張可能超出範圍的原因有很多,包括第三方無法存取數據、評估者專業知識不足,或評估緊急時合理的時程限制。實驗室和評估者應建立一個流程,以考慮在原始範圍之外發現的重大風險,包括是否需要進一步調查。結論應明確說明與雙方同意的範圍相關的哪些內容已評估,哪些未評估。
**相稱的存取權限:** 評估者應在法律、安全和智慧財產權限制的範圍內,盡可能獲得相稱的存取權限來評估商定的主張。如果直接存取不切實際或不可能,評估者可以與公司指定的代表合作,或探索間接或保護隱私的存取機制,以保護底層資訊。
**透明的方法論和標準:** 評估者應解釋他們的方法、評估標準和不確定性,並在有既定標準的情況下加以引用。如果尚無標準,他們應清楚說明所使用的標準。報告應區分直接發現和解釋,解釋不確定性,並明確說明證據支持哪些結論。
**專業知識和獨立性:** 評估者應展現相關的技術專業知識,並識別、揭露和處理組織和個人的利益衝突,包括財務誘因、與開發者的關係以及先前參與被評估工作的經歷。應設計安全措施,以確保商業壓力或報酬安排不會影響評估結果,並可能包括迴避或適當的排除期。
**安全與保密:** 評估者應展示資訊安全實踐和可執行的保密保護措施,涵蓋其人員,並與所存取系統和資訊的敏感性相稱。這些保護措施應涵蓋智慧財產權、敏感資訊和評估記錄。如果評估者無法在其自身環境中滿足安全要求,或所存取的數據特別敏感,則在公司管理的設備或場所進行存取可能更為合適。
**可操作的發現和補救時間:** 評估應識別具體差距,並提供足夠的細節供實驗室解決。在適當情況下,實驗室應有合理的期限在發布前補救問題。在相關情況下,報告還應解釋對代理開發者、部署者和防禦者的經驗教訓,並提出實用的實施建議。
**負責任的發布實踐:** 評估報告應以負責任的方式發布,平衡透明度與保護敏感資訊的需求。
