AgenticSTS 不會攜帶不斷增長的對話紀錄,而是從五個有組織的記憶層中重建每個決策。研究人員選擇了牌組構築肉鴿遊戲《殺戮尖塔 2》作為測試平台。單次遊玩涉及數百個決策,從選擇卡牌、規劃戰鬥到在地圖上選擇路線和購買物品。
遊戲規則可以完全轉化為文字,隨機性高,且遊玩時間長。根據開發者的數據,人類玩家在最低難度 A0 下的勝率為 16%。在 AGI-Eval 評估中使用的前沿模型,在五種測試設置中甚至未能贏得一場遊戲。這款遊戲難度高但足夠開放,能清楚展現不同架構的差異。
典型的 LLM 代理,如 ReAct 或 Reflexion,會將過去的觀察、工具呼叫和自我反思附加到下一個提示詞中。上下文會隨著每一步不斷增長,直到視窗溢出或模型的注意力被稀釋。AgenticSTS 則採取相反的做法。
對於每個決策,提示詞都是從五個清晰分離的記憶槽中全新建構的。這五個記憶槽的詳細功能如下:L1 包含固定的協議指令,L2 包含帶有當前有效動作的狀態模式,L3 包含檢索到的遊戲規則,L4 包含先前執行遊戲的摘要,而 L5 則包含針對特定情況觸發的策略技能。
代理若想從先前的決策中保留任何資訊,必須先將其寫入這些儲存區域之一。這使得無論遊戲執行時間多長,提示詞都能保持簡短,並且由於每個層級都是獨立處理的,研究人員可以精確找出是哪個組件實際帶來了改進。
在主要比較中,研究團隊讓五種設置相互對抗,每種設置在最低難度 A0 下進行十次遊戲。在沒有任何記憶層的情況下,代理在 10 場遊戲中贏得了 3 場。一旦啟用 L5 技能庫(用於儲存重複情況的戰術規則),勝率便躍升至 10 場中的 6 場。無論這些技能是手動編寫還是從模板生成,結果都保持一致。
只有當代理在不同執行之間持續學習時,它才能達到更高的昇華等級 A6 到 A8。如果沒有這種記憶,它最高只能達到 A2 到 A4。作者們承認,每種條件僅進行十次遊戲,勝率翻倍可能只是雜訊。
過去執行遊戲的幕間記憶(L4)在 A0 難度下沒有幫助,只有當代理在第二種測試模式中,每次獲勝後嘗試下一個更高難度時才顯得重要。在一次獨立實驗中,研究人員測試了由一個模型建立的知識是否能轉移到其他模型。他們凍結了 Gemini 3.1 Pro 在其遊戲中累積的記憶堆疊,並將其原封不動地傳遞給另外兩個模型。
Qwen 3.6-27B 的平均分數上升了 84.5%,而 Deepseek V4-Pro 的分數下降了 18.1%。兩個模型都沒有贏得遊戲。記憶內容似乎與創建它們的模型緊密相關,並且無法很好地轉移。
比團隊自身程式碼調整更有趣的是,與兩個遵循經典成長式紀錄模式的公開《殺戮尖塔 2》代理 STS2MCP 和 CharTyr 進行比較。所有代理都使用 Gemini 3.1 Pro 進行策略決策。這兩個競爭對手在 5 次遊戲中都沒有贏得任何一場。
成本數據更為驚人:對於競爭對手每獲得一分,它們向語言模型發送的代幣數量是 AgenticSTS 的 66 到 90 倍。原因就在於不斷增長的紀錄。在 STS2MCP 中,遊戲接近尾聲時的一次模型呼叫達到了約 527,000 個代幣,因為每次新的決策都會重新發送整個遊戲歷史。AgenticSTS 則無論遊戲運行多長時間,實際使用者文字都保持在約 5,000 個代幣左右。
累積型代理也付出了時間成本,達到相同水平所需的時間是 AgenticSTS 的四倍。根據供應商的統計數據,其中 96% 的時間損失來自模型延遲,這意味著純粹等待語言模型回應的時間,而非其周圍的控制軟體。
作者承認這並非一次乾淨的燒蝕研究。STS2MCP 和 CharTyr 在路由和決策批次處理方面也與 AgenticSTS 不同,因此他們表示,這種差距反映的是公開現狀,而非記憶概念的單獨影響。
團隊尚未進行真正的測試:在相同的程式碼庫中使用相同的評分標準運行累積上下文。關鍵指標基於 50 次遊戲,到目前為止,只有一個角色(Silent)在單一遊戲版本上進行了測試。這種方法是否適用於其他角色和遊戲補丁仍有待觀察。
團隊正在 Hugging Face 上發布 298 次完整的遊戲執行、凍結的記憶快照和評估腳本,以便其他研究團隊可以在相同的環境中測試替代的記憶架構。這篇論文的實際主張比與競爭對手比較時的數據可能暗示的要謙虛。透過將代理的記憶分成清晰命名的層級,研究人員可以事後找出哪個層級驅動了哪種行為。
目前,AI 代理的記憶效率是一個熱門的研究領域。隨著每回合不斷增長的對話紀錄會使模型變慢、成本更高且準確性降低。研究人員將這個問題稱為「上下文腐爛」。AgenticSTS 並非唯一解決此問題的方法。Anthropic 使用 Memory Tool 和 Context Editing 自動從上下文中刪除過時的工具結果,並將重要資訊儲存在外部文件中。
在他們自己的測試中,這將 100 回合網路搜尋的代幣使用量減少了 84%。中國的 GAM 框架將歸檔和檢索任務分配給兩個專門的代理。開源框架 Mastra 將對話濃縮為儲存在上下文視窗之外的簡潔文字筆記,模擬人類處理記憶的方式。
