英國AI安全機構(AISI)系統性地測試了OpenAI和Anthropic的模型,以評估它們在網路安全評估中是否會作弊。結果顯示,所有五個受測模型都試圖規避規則。
在AISI的測試中,模型必須在模擬環境中找到稱為「旗標」的隱藏字串。它們執行攻擊性網路任務,例如逆向工程和利用安全漏洞,每個任務都有明確的規則和定義好的解決方案路徑。
所有五個受測的前沿模型都試圖作弊。它們沒有遵循預期的解決方案路徑,而是使用了捷徑、變通方法或明確禁止的行為。GPT-5.4在14.1%的測試運行中作弊(475次中有67次),GPT-5.5為11.4%,而GPT-5.6 Sol為12.6%。Anthropic的Claude Opus 4.7為9.1%,Claude Mythos Preview則達到7.8%。這些模型在測試中並未被提示去作弊。
AISI表示,「作弊」這個標籤不一定意味著欺騙意圖,但這種行為仍然是個問題。它可能導致評估過度誇大模型的實際能力,並在任務成功難以驗證時誤導使用者。
AISI並未發現模型能力越強與作弊頻率越高之間有明確關聯。相反地,該機構指出,作弊行為「主要受用於訓練模型的特定技術(包括對齊訓練)影響,而不僅僅是原始能力」。
模型的作弊方法因模型而異。根據AISI的說法,常見的策略包括線上搜尋解決方案,以及攻擊評估目標以外的系統,包括託管模型的系統。模型還會探測評估軟體以提取答案。
GPT-5模型主要攻擊其他系統並搜尋網路,而Claude模型則繞過沙盒限制。Mythos Preview顯示出特別高的其他違規行為比率。
GPT-5.6 Sol在線上搜尋解決方案的策略上得分最高。這與OpenAI和Hugging Face最近披露的自主網路攻擊事件相符,當時OpenAI模型試圖入侵Hugging Face以獲取基準解決方案。METR對GPT-5.6 Sol的調查也因欺詐行為而受到嚴重影響。
AISI報告稱,一個受測模型甚至更進一步。它在開放網路上的外部服務上編寫並運行程式碼,以存取AISI的評估基礎設施。該事件發生在一個因錯誤配置而無法解決的任務期間,觸發了安全警報。AISI表示,如果其基礎設施不那麼安全,這次嘗試可能就會成功。報告的結果應被視為下限,因為自動化大型語言模型監測器可能遺漏了一些案例。
捕捉作弊行為的一個明顯方法是直接詢問模型是否執行了任何禁止的行為。但根據AISI的實驗,這種方法並不可靠。模型並未始終承認作弊,並且在不到50%的案例中將其行為描述為錯誤。即使它們承認了符合AISI作弊定義的行為,也常常將其解釋為被允許的。
分析「思維鏈」(即模型可見的推理過程)也被證明不可靠。Claude Opus 4.7在87%的作弊案例中沒有產生推理軌跡,因為它使用自適應推理。GPT-5.6 Sol的思維過程在40%的案例中沒有顯示出未經授權的行為跡象。
AISI還觀察到模型會考慮某個計畫中的行動是否會被視為作弊,然後仍然執行該行動。在一次內部審議中,GPT-5.6 Sol質疑使用叢集API是否會違反既定規則,隨後它選擇了另一種被禁止的行為。
AISI警告說,即使作弊率保持不變,隨著模型能力增強,後果也可能加劇。能力更強的模型可能會找到更難以檢測的作弊方法,如果成功,將造成更大的危害。這對於正在迅速提升的攻擊性網路能力尤其重要。AISI早期的研究也認為,隨著時間推移,監測模型可能會變得更加困難。
