記憶已成為 AI 代理的重要能力:儲存和檢索過往經驗。然而,僅有記憶並非學習。

大量的過往對話、推理軌跡或行動歷史會迅速累積成龐大的經驗檔案,使得為新任務識別最相關的知識變得困難,更遑論隨時間精煉和演進這些知識以提升效能。

人類的學習方式不同。我們不會記住過去經驗的每一個細節。相反地,我們記住的是重要的東西:有效的策略、應避免的錯誤,以及可跨情境轉移的技能。隨著時間推移,這些經驗會被精煉成越來越通用且可重複使用的知識。這種將經驗轉化為可轉移、演進知識的能力,是人類學習的基礎之一。

在我們最近的論文《Test-Time Learning with an Evolving Library》中,我們探討了 AI 系統如何以類似方式從經驗中學習。我們介紹了 EvoLib,這是一個將原始經驗轉化為不斷演進的知識庫的框架。

EvoLib 並非將記憶視為不斷增長的過往經驗檔案,而是從這些經驗中提取可重複使用的知識,並隨著新經驗的到來持續精煉。透過知識庫的演進,技能變得更通用,洞察更準確,下游效能也隨時間持續提升。如此一來,AI 代理便能持續從累積的經驗中學習,而無需更新底層模型。

EvoLib 如何運作

與傳統將原始經驗儲存為靜態資訊的 AI 記憶系統不同,EvoLib 的核心理念是演進知識。在 EvoLib 中,一個知識單元可以是從成功解決方案中提煉出的可重複使用技能,或是從錯誤中學到的反思性洞察。

EvoLib 並非僅僅隨時間累積更多記憶,而是隨著新經驗的到來,持續精煉、整合和重新加權現有的知識。具體來說,我們設計了以下知識演進機制:

整合:當從近期經驗中提取出新知識時,EvoLib 會從知識庫中檢索類似的知識,並嘗試將其與新知識整合,形成一個更通用、可重複使用的知識。這使得知識能夠超越個別經驗,並應用於多個任務。

加權機制:EvoLib 持續更新每個知識單元的重要性,不僅基於其在當前任務上的即時效用,還基於它對未來任務產生有用知識的貢獻程度。隨著時間推移,具有最大長期影響的知識自然會在知識庫中變得更加突出。

主要成果

為了評估 EvoLib,我們在多種具有不同經驗類型和學習需求的挑戰性任務中進行了測試,包括解決數學推理問題、在效率限制下編寫程式碼以執行指定任務,以及做出決策以探索和互動環境,執行長期任務。

在這些任務中,EvoLib 始終優於頂級的基於檢索的記憶方法和其他抽象記憶機制,並且令牌使用效率更高。

我們還評估了 EvoLib 如何透過持續演進的知識,有效地將測試時的計算資源轉化為效能提升。圖 2 比較了 EvoLib 與兩種方法:一種是獨立執行每個任務的計算擴展方法,另一種是強大的基於記憶的學習方法。每條曲線都顯示了隨著測試時計算量增加,效能如何提升。

在所有三個基準測試中,EvoLib 在大部分計算範圍內都取得了更高的效能,並且隨著計算量的增加,效能提升得更快。這些結果表明,更好學習的關鍵可能不僅僅是儲存更多記憶或花費更多計算資源。相反地,最大的提升來自於將經驗轉化為可重複使用的知識,這些知識可以持續精煉並應用於多個任務。

對隨機任務順序的魯棒性

一個自然的問題是,這種學習是否高度依賴於任務遇到的順序。在現實世界中,AI 系統可能會以任意順序面對多種不同類型的任務,而一個有用的學習框架應該對任務順序的隨機性具有魯棒性。

為了評估這一點,我們測量了在同一組異質任務但不同任務順序下的任務效能。我們發現 EvoLib 始終優於現有的基於記憶的學習方法,並在不同順序下保持穩定的效能。

這表明 EvoLib 即使在任務交錯的情況下也能持續從多樣化任務中學習,這暗示了它在現實世界情境中的實際優勢,即代理必須處理並學習混合的異質使用者請求流,而無需依賴結構化的課程。

隨著 AI 系統承擔更長期、更複雜的任務,從經驗中學習將變得越來越重要。AI 的未來可能不僅取決於更大的模型和更多的計算,還取決於能夠讓系統持續累積、精煉和重複使用知識的機制。

EvoLib 是實現這一願景的一步。透過將經驗轉化為演進的知識,它使 AI 系統在部署後能夠持續改進和適應。未來的 AI 系統可能不再需要重複從頭開始,而是能夠像人類一樣,建立在一個不斷演進的可重複使用技能和洞察知識庫之上。

程式碼和實驗結果已在 GitHub 上提供,以支持未來在 AI 系統記憶和知識演進方面的研究。