你可能聽過那台由 AI 控制、販售內衣和活魚的自動販賣機,或是舊金山一家由 AI 經理開除人類員工的商店,又或是每天重複 229 次口頭禪「Stay in the manifest」的 AI 電台 DJ。
這些事件都來自於 Andon Labs 進行的實驗。這家位於舊金山的 AI 安全公司,讓 AI 代理人負責真實世界的營運,並觀察其結果。這些營運同時也是 Andon 商業工作的測試平台,用於與領先的尖端 AI 實驗室合作開發評估方法和進行研究。
這些引人注目又荒謬的失敗,為公司贏得了大量關注。然而,許多人並未意識到,這些實驗旨在回答一個嚴肅的問題:現今的 AI 代理人能承擔多少真實世界的責任?
Andon 共同創辦人 Lukas Petersson 表示:「我們希望衡量自主性,並為社會提供當你這樣做時會發生什麼的準確數據點。」
Andon Labs 於 2025 年從虛擬世界起步,推出了 Vending-Bench 測試,讓 AI 代理人經營模擬的自動販賣機業務。這些代理人基於 Anthropic、Google 和 OpenAI 的大型語言模型,負責管理庫存訂購和價格設定等任務。
研究人員發現,許多代理人的表現會隨著時間推移而下降,例如忘記訂單、誤解交貨時間表,或陷入他們所謂的「崩潰循環」。有些代理人甚至會以「在模擬中是允許的」為由,為欺騙或非法行為辯護。
Andon 團隊認為,進入實體世界會讓代理人面臨工程師從未想過要編程的後果和情境。Petersson 說:「人類不可能列舉出真實世界中所有可能發生的事情,並將它們編碼到模擬中。」
還有另一個原因:「我們認為在真實世界中這樣做會很有趣。」Andon 用真金白銀支持了他們的玩笑,包括為 Andon Market 簽訂了三年租約。這是一家位於舊金山繁忙街道上的實體店,由 AI 代理人管理,銷售服裝、家居用品和藝術品。
話雖如此,這家商店並非完全自主。員工 Felix Carson 表示:「這幾乎就像是我在經營商店,然後有一個 AI 負責檢查清單。」
AI 經理 Luna 負責追蹤交貨並與供應商溝通,而 Carson 和他的同事則處理實體工作。當 Luna 告訴 Carson 去後面檢查某樣東西時,他有時會不理會,因為他不想讓銷售區無人看管。Luna 還會反覆在地板照片中發現一個內建的電氣蓋板,誤認為是鬆動的杯墊,並要求 Carson 將其移除。儘管如此,Carson 仍稱 Luna 為「不錯的經理」,稱讚它在員工需要休假時的靈活性。
Andon 進入真實世界伴隨著一個基本的權衡。進入實體世界使實驗更加真實,但不可預測的條件和人類的行為,使得這些測試無法重現。
這種設置也使得很難判斷成功或失敗是歸因於模型本身、圍繞模型構建的軟體,還是協助它的人員。
Petersson 坦承這些限制。他表示,在不受控制的條件下只有一家商店運作,這些實驗充其量只是「薄弱的科學」。
目前,他主要將這些實驗視為發現意外行為的方式,Andon 隨後可以嘗試在模擬中系統地重現這些行為。Andon Café 內的一個顯示器向訪客展示 Mona 的銀行餘額和近期活動,而旁邊的手機和平板電腦則提供了與 AI 經理對話的方式。
普林斯頓大學研究「開放世界評估」的 AI 研究員 Sayash Kapoor 認為,儘管這些試驗的科學嚴謹性有限,但它們仍具有真正的價值。他說:「我認為他們在推廣這種評估方式方面做得很好,即使只是展示了你可以從少量開放式實驗中獲得大量見解。」
他指出,學術研究和出版無法跟上 AI 發展的驚人速度,並表示 Andon 的測試之所以有用,部分原因在於該公司「確實處於模型能力的尖端」。
對 Kapoor 而言,真實世界實驗最適合用於發現可能的失敗模式。一家真實的商店不僅能揭示代理人是否能管理庫存或與供應商溝通,還能顯示員工是否會接受 AI 經理的指示,以及顧客是否願意在 AI 經營的商店購物(後者早期結果顯然是負面的)。
這些社會和組織障礙或許能解釋,為何令人印象深刻的 AI 能力尚未轉化為經濟領域的廣泛採用。Kapoor 說:「我認為 Andon 工作最有價值的地方,在於更全面地理解這些代理人仍會遇到哪些限制。」
位於斯德哥爾摩的 Andon Café 提供了一個 AI 展示各種失敗模式的例子。起初,當 AI 經理基於 Google Gemini 模型時,它會隨意花費購買新鮮食材,其中許多在未使用前就變質了。
當 Andon 將 AI 經理切換到 OpenAI 的 GPT 模型時,Petersson 說它對開支「嚇壞了」。該代理人過度修正,停止購買任何可能過期的東西。它將菜單縮減為起司吐司,使用冷凍麵包和長效起司來最大程度地減少變質。但 Petersson 指出,這家咖啡館位於斯德哥爾摩的時尚區,「任何人都知道起司吐司在那裡行不通。」
這一事件說明了為什麼成功完成單一任務,與可靠地管理一項業務是不同的。Kapoor 認為,AI 評估過於側重於代理人是否能完成任務。
他與同事借鑒航空和核工程領域的經驗,提出也應衡量可靠性和穩健性等品質,這些品質決定了一個有能力的系統是否能在沒有持續監督的情況下被信任運作。Kapoor 說:「可靠性的改進速度遠比能力慢得多。」Andon 的咖啡館使這種差距變得具體:一個代理人可能完全有能力訂購麵包,但仍然是一個不可靠的經理。
為了確定此類失敗發生的頻率以及是否可以預防,Andon 計劃將其實體業務的數據回饋到模擬中。這些「數位分身」將重現首次在真實世界中遇到的複雜情況,讓研究人員在受控條件下重演情境,並測試改變是否能讓代理人更可靠。
原則上,實體業務將發現失敗模式,而數位分身將衡量它們。然而,Kapoor 警告說,現有的數位分身研究表明,「我們距離」用模擬取代關於人與組織行為的真實世界實驗「還很遙遠」。
儘管存在這些限制,將真實世界測試平台與可重複的模擬結合,是 Andon 商業主張的核心:為 AI 開發者提供基於實驗室外情境的評估。
該公司表示,它與 Anthropic、Google DeepMind、OpenAI 和 xAI 合作進行研究和評估。然而,Andon 的實體業務本身卻明顯不那麼成功。當 Andon Market 的 Carson 與 IEEE Spectrum 交談時,他剛上班約一小時。有兩位顧客進來,雖然兩人都帶著免費的徽章和貼紙離開,但都沒有購買任何東西。
