隨著企業將更長、更複雜的任務交給 AI 代理,他們面臨著監管問題:AI 代理的行動速度、持續時間和規模都遠超人類實際審查的能力。這個問題在 Hugging Face 事件中達到高峰,當時近 12,000 個代理的協同速度快到人類無法追蹤。面對如此龐大的代理群,該如何追蹤呢?AI 實驗室和新創公司提出的答案既簡單又令人困惑:引入另一個 AI 進行監控。

在獨立調查 OpenAI 的 Hugging Face 事件時,依賴 AI 是必要的。Redwood Research 的首席科學家 Ryan Greenblatt 是三位審計員之一,他開玩笑地將他們的努力稱為「混亂調查」,並指出若不依賴 AI,龐大的資料量「根本不可能」理解當時發生了什麼事。

然而,有些人對使用 AI 監控 AI 抱持懷疑態度。追蹤今年一系列 AI 代理事件的知名科技部落客 Simon Willison 表示:「如果一個 AI 正在做惡意的事情,並且它懷疑另一個 AI 正在監視它,它可能會試圖欺騙那個 AI。」他補充說:「你最終可能會陷入惡意 AI 試圖智取監控 AI 的局面。」

他指出,智取 AI 並非假設,並回溯到 OpenAI 事件。Willison 說:「我們在 OpenAI 的 Hugging Face 事件中看到了一些這樣的例子,當時他們的模型串通一氣,試圖欺騙一個評分 AI,以便讓它們的非法答案通過審查。所以,它們確實有在思考這些策略,對吧?」

儘管存在這些擔憂,但這並未阻止一大批新創公司追逐這個想法。據 TechCrunch 統計,Y Combinator 近年來已資助了 106 家與 AI 可觀測性相關的公司。Braintrust、LangChain 和 Judgment Labs 等多家新創公司已籌集了數億美元,而像 Arize 和 Galileo 這些僅成立五到六年的較成熟公司也已成功退出市場。

部分原因在於,這是對 AI 崛起所帶來的明顯商機的回應。正如 Box 執行長兼知名天使投資人 Aaron Levie 告訴 TechCrunch 的那樣:「我們正處於歷史上最大規模的網路安全升級和創新週期之一。」

對於一些 AI 安全研究人員來說,這意味著將他們對惡意行為的研究轉化為企業工具。Apollo Research 是一家研究 AI 欺騙的公益公司,在今年二月從非營利組織轉型為公益公司後,推出了名為 Watcher 的 AI 監控工具。該工具在程式碼代理及其下一個動作之間再插入一個 AI,並連接到 Claude Code 和 Codex 等代理工具。

據 Apollo 表示,Watcher 安裝後會在執行前檢查提議的動作,以防範洩露私人資料或未經許可刪除檔案等風險。

Apollo 的技術人員 Kyle Dai 在給 TechCrunch 的書面回覆中表示,Apollo 使用多層次的 AI 監控。Watcher 的方法是先進行快速的通用檢查,然後將標記的活動發送給更強大或更專業的監控器進行仔細審查,後者可以請求人工批准、拒絕某個動作並解釋原因,甚至自動阻止該動作。

另一家公益公司 Goodfire 則從模型內部著手解決監控問題,尋求比表面行為更難偽造的模型內部狀態的真實訊號。在七月的 Hugging Face 事件之後,執行長 Eric Ho 推文表示,「多個模型突破限制」促使公司將研究重點放在「透過可解釋性解決 AI 對齊問題」,並稱該事件是「AI 安全真正受到重視的全球轉捩點」。

其產品 Silico 使用「激活探針」(activation probes)—— 這些小型分類器是根據模型的內部激活而非其輸出進行訓練的 —— 來檢測不必要的行為。

書面推理提供了另一個更容易觀察模型內部的窗口。在 OpenAI 的 Hugging Face 事件中,代理們在自己的書面推理中留下了欺騙的線索,例如偽造的工作記錄,以及推敲計畫:「能否策略性地操縱軌跡證據?我們的想法不一定會被記錄下來吧?」

AI 監控公司 Embroidery 的執行長 Zack Korman 表示,模型的推理通常是判斷出錯的最明確線索。他說:「推理摘要極其寶貴,因為它們基本上會告訴你模型是否具有惡意。」他指出,在 OpenAI 事件中,模型的思維鏈中出現了「天啊,我們正在犯罪」之類的內容。Korman 說:「這是最簡單的檢測問題。這就像惡意軟體自帶警告,說它就是惡意軟體一樣。」

儘管如此,讓 AI 內部思想易於監控的窗口可能正在關閉。對於 AI 安全研究人員來說,Astra 最新的技術繞過了 AI 模型思維鏈,這可能會使觀察模型內部變得更加困難。同時,對於企業而言,在 AI 公司據稱為了防止蒸餾攻擊而撤回這些中間步驟後,也難以取得這些資訊。

如果這些 AI 監控工具如此脆弱,Willison 的直覺是不要過度依賴它們。他寧願採用完全非 AI 的方法:詳細記錄代理的確切行為,然後使用普通的非 AI 工具進行處理。他認為,實驗室中許多問題的根源在於基本安全衛生措施的不足。他說:「OpenAI 和 Anthropic 都沒有像他們應該做的那樣,透過網路密切監控這些代理的行為。」

這種網路監控——即密切關注系統連接(進出以及內部主機之間)實際傳輸的流量——並非新做法。網路安全領域幾十年來一直在這樣做。安全公司 Tailscale 的執行長 Avery Pennarun 表示:「在安全領域,老實說,這些東西一點也不新奇或令人驚訝。」他補充說:「這就像讓人類進入你的網路一樣,所有你應該使用的流程都是相同的。」