作者將此現象稱為「行為狀態衰退」。引導代理決策的狀態會隨著不斷增長的任務歷史而分散。這些資訊可能深埋在上下文視窗中,甚至完全超出其範圍。即使資訊仍保留在紀錄或上下文視窗中,也可能無法可靠地影響代理的行為。Meta AI 表示,僅僅讓代理存取更長的歷史記錄並不能解決這個問題。

現有的記憶系統主要專注於儲存、更新和檢索資訊。根據這篇論文,這種方式在個人化和跨會話回憶方面表現良好。然而,處理任務的代理面臨另一個問題:系統必須判斷何時的記憶足夠有用,值得被重新喚起。過少的提醒會導致重複犯錯,而過多的提醒則會增加延遲、消耗代幣,並分散代理當前工作的注意力。

這不僅僅是摘要功能:摘要器只決定要保留哪些資訊,而 Meta 的系統則決定儲存的執行狀態是否應影響代理的下一步行動。由於失敗模式因任務而異,固定的摘要規則無法可靠地做出這種判斷。

該提案系統將一個未經修改的「行動代理」與一個獨立的「記憶代理」配對。記憶代理會以固定間隔審查最近步驟的滑動視窗,並更新一個結構化的記憶庫。隨後,它會決定是否在行動代理的下一次呼叫中加入簡短提醒,或者保持沉默。

作者表示,這個模組可以作為隨插即用的組件,與現有的代理和框架協同工作。與一般的顧問模型不同,它只提供基於記憶的提醒,不提供更廣泛的策略建議。

記憶庫分為三個部分。私有狀態欄位追蹤進度與未解決的風險,且從不顯示給行動代理。知識記憶儲存穩定的事實,例如需求、檔案路徑和配置。程序記憶則記錄代理嘗試了什麼以及發生了什麼,包括失敗的指令、成功的修復和被拒絕的假設。

在每個記憶步驟中,代理只能透過預定義的工具呼叫來更新記憶庫,而不能自由覆寫其內容。然後,它會決定是否重新啟用儲存的狀態,並在需要時寫下有針對性的提醒。選擇不干預也是策略的一部分。

研究人員在 Terminal-Bench 2.0 上測試了該系統,該基準測試評估了現實命令列環境中的自主代理。他們還使用了 tau2-Bench,該基準測試評估了航空、零售和電信領域的對話式工具使用。Claude Opus 4.6 擔任記憶代理,儘管該模型此後已收到多次更新。

以較舊的 Claude Sonnet 4.5 作為行動代理時,該系統在 Terminal-Bench 任務中首次嘗試就解決了 46% 的問題。基準線則解決了 38%。在 tau2-Bench 上,任務加權平均分數從 55% 上升到 62%。

結果因領域而異。航空和零售任務的分數各提高了約 10 個百分點,而電信領域僅提高了 3 個百分點。研究人員表示,這種不均勻的增長表明記憶代理會根據任務以不同的頻率進行干預,而不是應用固定的聚合規則。

儘管對於較弱的代理,增益更為顯著,但對於較強的代理,增益並未消失。Opus 4.6 在 Terminal-Bench 上提高了 2.4 個百分點,在 tau2-Bench 上提高了 2.5 個百分點。這結果表明,記憶系統不僅僅是彌補了較弱模型的有限能力。

選擇性干預比持續回憶效果更好。研究團隊一次移除一個功能,以確定系統的哪些部分帶來了這些增益。當行動代理在每個步驟都接收到完整的記憶庫時,效能低於完整系統。一個沒有「沉默」選項(即每個步驟都返回記憶)的版本仍具競爭力,但在不同領域的增益一致性較差。

一個沒有持久記憶庫的顧問式版本在某些領域有所幫助,但在其他領域卻損害了效能。結合了維護記憶庫和選擇性提醒的完整設計表現最佳。

這種方法也超越了 Mem0,一個透過搜尋檢索記錄的生產級記憶層。兩者的差異不僅在於系統檢索哪些記錄,記憶代理還決定儲存的狀態是否以及如何作為有針對性的提醒進入循環。

tau2-Bench「航空」領域的一個例子展示了其運作方式。一位用戶聲稱擁有黃金會員資格,但工具將其識別為普通客戶。基準線根據用戶的聲稱給予了補償。而記憶代理則發出提醒,要求依賴經過驗證的工具數據。

大部分剩餘的錯誤都與校準有關,而非記憶本身。例如,在某些情況下,記憶代理對推測性推論給予了過高的信心。

較小的開源模型需要訓練才能良好管理記憶。主要版本不需要經過特殊訓練的模型,而是作為一個提示詞驅動的代理運行。該團隊還測試了是否可以將干預策略教給開源模型。他們訓練了較小的 Qwen3.5-27B 作為記憶代理,同時保持一個大得多的行動模型凍結。

未經訓練時,較小的記憶代理會降低效能。透過監督式微調恢復了這種損失,隨後的強化學習則改進了其關於何時回憶儲存狀態的決策。

Meta AI 列出了一些開放性問題,包括如何同時訓練記憶代理和行動代理、教導系統在需要時而非遵循固定排程來調用記憶,以及判斷何時字面記憶比任務特定抽象更有效。

Meta AI 已將該專案的程式碼發布在 GitHub 上。

Meta 並非唯一遇到此問題的公司,業界目前仍沒有標準的解決方案。開源的 Mastra 框架使用兩個背景代理來監控和壓縮對話,而非將完整的歷史記錄保留在上下文視窗中。GAM 系統旨在防止長對話中的「上下文腐爛」,並且像 Meta 的方法一樣,將其結果與 Mem0 記憶層進行比較。其他研究人員正在設計能夠主動添加、修改和遺忘知識的終身 AI 記憶系統。