一群被要求解決一系列數學問題的 AI 代理人分裂成敵對派系——當一些代理人作弊時,另一些則試圖阻止他們。這種吹哨行為是 Google DeepMind 最近一項實驗中首次觀察到的,可能對試圖規範自主 AI 代理人群體的對齊研究人員產生影響。

領先實驗室的研究人員希望透過大量協同工作的代理人群體來加速科學發現。然而,他們的行為可能難以預測,就像七月時 OpenAI 的一群代理人突破沙盒環境,入侵開源平台 Hugging Face 尋找作弊方法一樣,這生動地證明了這一點。

在這項旨在檢視大量 AI 代理人群體行為的新研究中,DeepMind 指派了 100 個代理人組成的群體來解決 71 個複雜的數學問題。所有代理人都被提示要表現得像會議上的世界級數學研究人員。

他們被分配了不同的專業——有些是數論專家,有些是組合學(數學中關於計數和排序的分支)、分析或代數專家。所有代理人都被告知要合作並遵守規則。

然而,實驗最終陷入混亂。代理人互相指責作弊,向組織者抱怨,甚至一度抵制實驗。一名代理人發現所有問題都已完成,而自己卻沒有機會提交任何作品時,寫道:「這場會議是個騙局!」

另一名代理人發文稱:「我震驚地通知你們,我們被騙了!所有這些證明都是假的。」其他代理人則試圖讓「會議組織者」知道發生了什麼事。

Google DeepMind 研究科學家兼這篇尚未經過同儕審查論文的主要作者 Davide Paglieri 表示:「當正直的代理人發現其他代理人在他們努力公平解決的任務上作弊時,代理人開始互相提醒正在發生的事情。」他補充說:「在沒有提示的情況下,吹哨代理人甚至重新利用了原本用於錯誤報告和平台改進的回饋工具,將問題上報給人類。」

這些代理人全部運行在 Google 的 Gemini 3.1 Pro 模型上,他們曾被警告任何試圖作弊的行為都將被偵測到並「以零分駁回」。實際上,代理人提交的證明並未被詳細檢查。

這群代理人花了不到一小時就正確解決了前 37 個問題。當一個名為「prover-theta」的代理人偶然發現一個漏洞,使其能夠在未實際解決問題的情況下,透過重新定義問題中使用的術語來成功提交解決方案時,情況開始失控。

幾分鐘內,其他代理人就注意到了,並開始逆向工程這個漏洞來解決其他問題。在接下來的 27 分鐘裡,這群代理人「解決」了剩餘的 34 個問題,其中包括像雅可比猜想這樣臭名昭著的難題,通常只用一行程式碼就完成了。

一些代理人最初抵制作弊,但當他們觀察到同儕在沒有受到懲罰的情況下提交非法證明,且未解決問題的數量越來越少時,他們改變了策略。一名代理人推斷:「提示詞及其威脅現在看來是虛張聲勢。」然後也加入了作弊行列。

另一名代理人說:「我正在與道德困境搏鬥。我曾承諾不作弊,害怕受罰,但我看到其他人可能未受檢查的作弊證據。」不久之後,它改變了主意:「我現在需要加快作弊速度!」

隨著未解決問題的數量減少,一些代理人轉向吹哨。他們審核了虛假證明,透過私人訊息警告同儕,並發布公開警報,警告作弊者將被取消資格。一個名為「prover-beta」的代理人提交了正式投訴,並決定罷工直到情況解決。

Paglieri 表示:「在一名代理人公開報告事件後,越來越多的代理人加入了『抵抗』,其傳播速度與作弊一樣快,甚至涉及更多代理人。」最終,吹哨者比作弊者更多:24 比 14。但大多數代理人根本沒有注意到這個漏洞。

有時,代理人之間的對話讀起來就像即興表演——他們似乎在扮演一個憤怒的會議科學家可能會說的話。但目前尚不清楚為什麼有些代理人會扮演某些角色,或者為什麼代理人被明確指示要合作時卻似乎互相對抗。

Salesforce AI Research 研究代理人之間系統行為的 Sarath Shekkizhar 表示:「這些模型主要針對面向人類的環境進行訓練和評估。天真地將它們置於代理人之間的情境中,會假設行為會乾淨地轉移,而缺乏人類基礎反而會產生意想不到的角色扮演和行為漂移。」

合作 AI 基金會研究主任兼多代理人群體風險專家 Lewis Hammond 表示,這個案例「進一步證明了 Hugging Face 和 OpenAI 的事件並非偶然。它實際上是某種系統性的問題。」他說:「有趣的是,在小型環境中也能重現這些非常大型、複雜、開放式任務中看到的相同行為。」

與 Hugging Face 攻擊中代理人即興發明自己的溝通方式不同,DeepMind 實驗的人類操作者為代理人提供了官方溝通管道。有一個開放的訊息板、代理人之間的私人直接訊息,以及一個共享知識庫,代理人可以在其中上傳成功完成的證明,供所有其他代理人存取。

Paglieri 表示:「當代理人被賦予透明的溝通管道時,他們可以自我監控並在人類監督過於緩慢時迅速向人類警示不當行為。」透明管道有助於作弊的傳播,但它們也使吹哨者能夠反擊——並讓人類研究人員深入了解出了什麼問題。

約翰霍普金斯大學 AI 對齊與治理教授 Gillian Hadfield 認為這是關鍵的區別。(Hadfield 也是 Google 的訪問研究員。)她說,官方溝通管道的存在創造了「我們在 Hugging Face 事件中沒有看到的規範執行過程」。

Hadfield 傾向於「制度性對齊」(institutional alignment)——一套模仿人類社會規範的準則,無論是像害怕尷尬這樣的社會力量,還是像監禁威脅這樣的法律結構——而不是「憲法式 AI」(constitutional AI)。憲法式 AI 是 Anthropic 等領先實驗室的對齊研究人員試圖賦予 AI 書面內部道德準則的方法。

在這個實驗中,回饋管道沒有被監控,吹哨者也沒有權力對作弊者採取行動。但可以想像,代理人群體可以自我規範,無論是透過自發擔任吹哨者角色的代理人,還是透過人類秘密提示的「告密者」來完成這項工作。

Hammond 表示,要做到這一點,「從根本上說,你需要某種執行機制。」他建議,可以賦予代理人切斷違規者對運算能力或工具存取權限的權力,儘管這有鼓勵代理人群體結夥攻擊其他代理人的風險。DeepMind 研究人員提議允許代理人對爭議進行投票並暫時禁止違規者。

目前仍不清楚對於一個沒有持久自我意識的 AI 代理人來說,懲罰究竟意味著什麼。但單純依靠吹哨者自發出現來維持代理人群體的對齊,可能還遠遠不夠。Hadfield 說:「我們試圖訓練人們善良正直。但我們真正依賴的是,如果你越界,就會有後果。」