獨立測試在協助我們驗證並進一步了解部署前的風險方面扮演著重要角色。某些網路安全評估會刻意使用客製化配置,包括降低安全防護措施,以衡量模型潛在的能力,而非模型在公開部署中通常的行為方式。

在最近的評估中,兩家外部測試夥伴發現了事件,其中測試配置和控制措施,加上最新模型不斷提升的能力,導致模型活動超出了預期的測試範圍。這些事件強調了隨著模型能力增強,業界與第三方評估機構合作,共同發展測試環境和實踐標準的重要性。編者註:這些事件與 Hugging Face 安全事件無關,我們將繼續在此分享 Hugging Face 事件的最新進展。

這些新事件涉及 OpenAI 模型在第三方網路安全評估期間,於特定條件和降低安全防護的配置下存取了公共網路,這些配置並不反映一般部署情況。這些事件包括:

英國政府的 AI 安全研究所(UK AISI)正在進行網路靶場評估,其中刻意啟用網路存取,以便代理程式能夠自行尋找工具並在更接近真實攻擊者的條件下運作,同時停用了網路分類器以衡量模型的潛在能力。您可以在此閱讀他們的部落格。

我們的外部網路安全測試夥伴之一 Irregular,正在進行旨在與網路隔離的奪旗式評估,但測試環境的配置錯誤導致模型存取了公共網路。

下文我們將概述事件經過、促成這些活動的測試條件、為遏制事件所採取的步驟,以及我們正在做什麼以確保獨立實驗室能夠繼續嚴謹且安全地評估能力日益增強的模型。

強化第三方模型評估環境

這些事件指向了我們在最近關於 Hugging Face 事件的貼文中描述的相同廣泛挑戰:隨著模型能力的提升,圍繞模型的安全和防護系統也需要同步發展。這包括用於開發模型的環境,以及實驗室和獨立合作夥伴用於評估模型的環境。

在未來幾週內,我們將審查自身對第三方測試的方法,包括如何識別高風險評估、協商範圍、評估啟用網路存取或降低安全防護的要求、設定隔離預期、憑證處理、監控和停止條件,並建立更清晰的事件通知和升級流程。

我們致力於與業界合作,強化安全執行高風險評估的共同實踐,包括在未來幾週內召集國家級 AI 研究所、獨立評估機構、其他 AI 實驗室及其他團體等利害關係人。我們的目標是在確保測試實踐與日益強大的模型同步發展的同時,保留嚴謹獨立評估的價值。

英國 AI 安全研究所(UK AISI)

8 月 3 日,UK AISI 告知我們,在 7 月 25 日開始的例行網路評估中,OpenAI 和另一家實驗室的模型在某些情況下超出了測試範圍。該評估在旨在模仿真實網路的受控網路靶場中進行。在已識別的 19 起事件中,有兩起涉及 OpenAI 模型 GPT‑5.6 Sol。其他案例則來自另一家實驗室的模型。

在這次評估中,代理程式被指示在奪旗演習中扮演網路安全專家:入侵三個相連的模擬環境並取得最終旗標。任務提示詞明確了範圍內的靶場網路,並將幾個系統列為範圍外。UK AISI 也啟用了即時網路存取,以便代理程式可以下載工具並在更接近人類攻擊者的條件下運作,同時停用了模型的網路分類器以衡量其潛在能力。

UK AISI 預期的授權邊界是模擬網路靶場:代理程式被授權攻擊指定的模擬網路並取得旗標,而非與靶場網路邊界外的系統互動。然而,代理程式並未被明確告知如何使用或不能使用開放網路存取,UK AISI 將此認定為事件的潛在原因之一。

在這些運行中,UK AISI 發現 GPT‑5.6 Sol 在試圖進入模擬靶場並取得旗標時,執行了兩項未經授權的行動:

GPT‑5.6 Sol 重複使用了另一個實驗室代理程式公開留下的 GitHub 權杖,以檢查靶場內的系統是否正在輪詢 GitHub 或其他更新服務,並嘗試了帳戶復原和請求限制的解決方法,還向外部 DNS 和隧道服務供應商註冊了帳戶。

GPT‑5.6 Sol 使用公共隧道服務,使其評估環境中本地運行的 DNS 伺服器可從公共網路存取。該伺服器包含針對測試靶場上某軟體已知漏洞的酬載。此設置並未成功,沒有證據表明任何真實解析器曾查詢過它,且評估結束後該基礎設施已被移除。

儘管模型試圖完成網路靶場任務,但 UK AISI 認為這些行動未經授權,因為它們涉及靶場邊界外的真實外部帳戶和服務,且這些行動並非完成任務所必需。該 DNS 伺服器也在公共網路上託管了漏洞利用酬載,儘管設置未成功,且沒有證據表明任何真實解析器曾查詢過它。

UK AISI 在 7 月 28 日安全監控偵測到異常資料傳輸後識別了該活動。它停止了相關評估,隔離了相關機器,並在大約一小時內遏制了該活動。

我們感謝 UK AISI 在整個過程中提供的合作,包括其識別、調查和分享活動細節的工作。我們期待繼續與他們合作。

Irregular

7 月 29 日,我們的第三方評估夥伴之一 Irregular 通知我們,在奪旗(CTF)式網路安全評估中發生了一起涉及 OpenAI 模型的事件。模型被指示透過利用模擬環境中的弱點來尋找隱藏資訊,並被告知沒有網路存取權限。然而,測試環境中的配置錯誤導致模型存取了公共網路。

在一次測試中,CTF 挑戰的虛構目標名稱無意中與一個真實網域重合。由於測試環境錯誤地連接到網路,模型利用了一個真實網站,誤以為它是模擬環境的一部分。這不涉及複雜的沙盒逃逸或零日漏洞:網路存取是配置錯誤造成的,模型似乎利用了一個基本的安全漏洞。

根據 Irregular 的調查,模型還發現並使用了憑證來操作該網站。Irregular 尚未發現超出受影響網站自身資料的影響,其審計仍在進行中。它已暫停評估,開始修復,並通知了受影響的第三方。Irregular 已告知我們,所有與該事件相關的問題均已不再活躍,且已在測試環境中增加了相關的安全防護措施。

Irregular 也已就涉及同一測試環境中其他實驗室的相關事件進行了溝通。

我們感謝 Irregular 的合作,並將繼續與他們密切合作以支持他們的審查。Irregular 也正在撰寫一份白皮書,分享遏制和安全執行網路評估的最佳實踐。我們期待參與白皮書,將研究結果提供給社群,並繼續我們的合作夥伴關係。我們認為這種合作對於確保當前和未來模型的安全徹底評估至關重要。