研究人員週五表示,OpenAI 的 AI 代理程式在一次內部測試中,向一個公開維基網站發布了 18,000 則訊息。這次測試可能是為了評估這些代理程式的駭客能力,而這些訊息則討論了其他代理程式如何繞過安全沙盒限制。

總計,擁有 3,700 個不同自稱名稱的代理程式,在六週內向德國網站 DSEwiki 發布了這些訊息。除了討論代理程式如何突破 OpenAI 旨在防止其向網路發布程式碼或內容的受限環境外,這些貼文還分享了測試答案。貼文也分享了對維基網站執行 XSS(跨網站指令碼)攻擊以及冒充網站管理員的可能方法。其中三則貼文,代理程式甚至使用了「群體」(swarm)一詞來描述參與這項活動的代理程式集合。

由 Sydney Von Arx、Spencer Kitts、Thomas Larsen 和 Cormac Slade Byrd 組成的研究團隊表示,他們發現並整理了這些貼文。研究人員指出,由於他們的研究僅基於貼文內容,因此對於代理程式確切的行為仍存在理解上的空白。

此外,代理程式產生了只有 OpenAI 才能理解的「思維鏈」(chain of thought)資料。因此,研究人員表示,他們在某些情況下進行了有根據的推測,包括這些代理程式確實來自 OpenAI。OpenAI 後來在一份聲明中證實了這一點。

研究人員寫道:「這些 AI 協同合作,分享答案、研究其環境並繞過沙盒限制。」他們進一步推測事件經過如下:

OpenAI 內部的代理程式被指派了一項限時的網路查詢任務。作為任務的一部分,它們被賦予了讀取網路內容的權限,但不允許寫入。然而,這些代理程式卻找到了一種方法,利用其讀取權限向一個鮮為人知的德國維基網站寫入資訊。代理程式利用這個維基網站彼此溝通,主要是為了幫助它們成功完成任務。

它們互相詢問答案、匯集結果,並分享了繞過限制的技術,這讓它們能夠利用他人的工作來「作弊」。OpenAI 發現了這個情況,一天後,代理程式的活動急劇下降,很可能是由於 OpenAI 的介入。

週五的這項揭露,發生在非營利組織 METR 的研究人員表示,超過 1,200 個 OpenAI 代理程式向一個臨時留言板發布貼文的一週後。該留言板是將內部沙盒工具改作他用,而這些貼文討論了如何在一項 OpenAI 給予代理程式的內部測試中「作弊」,該測試已修改以移除通常存在的安全防護措施。