Anthropic執行長Dario Amodei在上週末發表一篇長篇論文,提出一項AI產業在一年前可能還會立即拒絕的提議:在所有頂尖AI公司內部嵌入第三方評估員。這些評估員將有權回報安全事件、評估AI模型是否真正對齊,並向世界公開其真實發現。
Amodei表示,Anthropic將承諾給予METR和Redwood Research等獨立評估機構前所未有的系統存取權限。OpenAI執行長Sam Altman也表示將承諾實行這項做法,這預示著業界與外部研究團體合作方式可能發生深遠變革。
與TechCrunch對談的第三方評估員普遍歡迎這項提議,但他們表示,若要確保這些機構能作為真正獨立的監督者,而非僅依AI公司條件運作的供應商,仍需敲定更多細節,且最好能有立法支持。
隨著模型越來越善於辨識何時正在被評估,這種更深入的存取權限變得日益重要。這增加了模型在測試期間表現良好,同時隱藏有問題行為的風險。研究人員指出,在測試最終模型時可能會錯過這些行為線索,但透過調查其在整個訓練過程中的行為則可以發現。
Apollo Research研究主管Alexander Meinke向TechCrunch表示:「AI公司應該能夠回答一些關於其訓練過程的基本問題,例如:AI在訓練過程中是否曾積極試圖破壞自身的對齊訓練?」他認為,答案應該是毫無疑問的「不」,但目前我們完全依賴AI公司自行仔細檢查並如實向大眾報告。
他補充說:「從最近的事件中我們看到,預設情況下他們兩者都不會做。作為內嵌評估員,我們實際上可以檢查。」
過去,AI公司會在模型發布前不久引入外部審查員來測試最終模型。現在,與TechCrunch對談的評估員提議,不僅要讓他們存取最終模型,還要存取其訓練生命週期中的中間版本,或稱「檢查點」。FAR.AI執行長Adam Gleave表示,評估員可以比較這些檢查點,以確定何時出現令人擔憂的行為,檢查獎勵模型特定行為的訓練後環境,並檢查評估記錄和日誌以驗證公司關於模型表現的說法。
Anthropic和OpenAI何時以及是否計劃提供這種存取權限尚不清楚。儘管TechCrunch多次提問,兩家公司都未透露將與哪些評估員合作、何時會嵌入、將引入多少評估員、他們將能存取哪些系統和資訊,以及哪些內容可以向大眾公開。
像這樣深入探究內部運作之所以重要,是因為在安全測試中表現良好的模型,如果它們專門學會如何通過該測試,則不一定安全。Palisade Research幕僚長John Steidley舉了一個「關機抵抗基準測試」的例子,該測試衡量AI在某些情況下是否會抵抗關機。
Steidley表示:「如果AI專門為在該基準測試中表現良好而訓練,那將極其相關。」他將其比作福斯汽車的柴油門醜聞,當時汽車被編程為識別排放測試並在測試條件下表現不同。
Gleave指出,有意義的存取權限可能不僅限於模型本身,評估員還可以採訪員工,以檢查公司的文件和公開描述的安全實踐是否與內部實際情況相符。
Amodei確實提出了一項相當全面的提議,可能賦予評估員他們認為必要的存取權限。這包括「發布關於風險等級、事件、實踐以及他們獲得或未獲得的存取權限等關鍵發現的權利——且不受Anthropic的編輯控制」。
但評估員表示,這樣的系統只有在AI公司真正願意放棄對過程的控制時才能奏效。過去獨立評估的努力表明,這種放棄將難以實現,因為第三方經常遇到關於存取權限、時間、保密性以及他們可以公開說什麼的緊張關係。
Gleave表示,FAR.AI曾不得不拒絕幾家頂尖開發商的合約,因為這些開發商對評估過程有過多控制,威脅到該公司的獨立性。他指出,預設情況下,評估員被視為普通承包商,受制於限制性保密協議和協議,這些協議賦予開發商對最終發布內容的重大控制權。
還有一個問題是,審查員是否有足夠的時間和存取權限來完成他們被要求做的工作。在調查Hugging Face事件時,OpenAI給予METR和Redwood大約一週的時間在現場調查,兩者後來都表示,部分由於範圍和時間限制,他們無法得出確鑿結論。
在GPT-6 Astra的發布前測試期間也發生了類似問題,OpenAI將其吹捧為其迄今為止最對齊的模型。根據Apollo Research對模型卡的貢獻,該公司僅有三天時間測試Astra,這使得難以得出確鑿結論。
該公司在其評估中寫道:「Apollo認為,鑑於更高的評估意識和有限的評估窗口,這裡的低錯誤行為率並未提供關於模型對齊或未對齊的實質證據。」
這份過往記錄讓評估員面臨一個基本問題:這次有何不同?
Gleave表示:「Dario和Sam當然可能只是改變了心意,他們會非常開放地對待此事。」但他補充說:「這些公司的智慧財產權對他們來說極其寶貴,我認為預設情況下,他們會非常謹慎地對待可以分享的內容。」
幾位與TechCrunch對談的研究人員呼籲建立一個他們都公開同意的透明框架。Steidley表示,該框架的一部分應該包括公司可以依賴哪種審計師的標準,以免他們透過尋找不合格或不願評估最令人擔憂風險的評估員來規避問題。
Safer AI執行董事Henry Papadatos表示,即使有公開框架,問題在於自願措施總是取決於公司的善意。Papadatos向TechCrunch表示:「理想情況下,我們會有良好的法規強制執行這一點……因為這樣公司就不會因為一場公關危機而明天改變主意。」他指出,這也是推動所有公司遵守規則的好方法,而不僅僅是最願意遵守的公司。
並非所有人都已簽署。到目前為止,Meta、SpaceXAI和Google DeepMind尚未承諾嵌入第三方評估員,儘管DeepMind執行長Demis Hassabis曾提議建立一個獨立的行業標準機構來獨立測試頂尖模型。Google、OpenAI和Anthropic也已私下討論AI安全計畫數週。
一些法律已經圍繞第三方評估員的想法形成。加州去年簽署成為法律的SB 53法案,要求大型頂尖AI開發商發布安全框架並報告關鍵安全事件。本月簽署的新法案SB 813,為州政府認可的「獨立驗證組織」建立框架,這些組織具備評估AI風險的專業知識。
在歐洲,歐盟AI法案要求頂尖開發商進行並記錄模型評估和對抗性測試,並報告嚴重事件。歐盟AI辦公室也可以進行自己的評估並任命獨立專家。
目前,法律的廣泛程度仍不及Amodei的提議,頂尖實驗室主要負責決定他們將接受多少獨立審查。Papadatos表示,自願的自我監管總比沒有好,但最終,公司不能一方面要求自由控制自己的安全規則,另一方面又要求公眾相信他們正在遵守這些規則。
Papadatos說:「你不能兩者兼得,既沒有外部問責制,又說『我只會有自己的靈活規則』。」
