大多數現有的視覺語言動作(VLA)模型,例如 OpenVLA、π0、RT-2 和 RDT-1B,都是「單一式」的。這表示它們直接生成原始的馬達指令或非常短的動作序列,而沒有將行為組織成可重複使用、定義明確的抽象概念。因此,這些模型在長週期(多步驟)任務上的表現不佳,並且難以解釋它們學到了什麼。
現有探索技能的方法通常會迴避判斷兩個動作序列何時「行為等效」的核心問題。例如,AtomicVLA 和 AtomSkill 透過聚類其對比嵌入來分組動作序列。相比之下,BLADE 和 LRLL 則依賴大型語言模型(LLM)來判斷兩個序列是否等效,但這些 LLM 並未針對機器人自身的動態進行校準。
我們引入了 REFACTOR-VLA,這是一個利用「清醒/睡眠」架構來學習可重複使用技能的系統。在睡眠階段,系統使用行為等效核心(BEK)對馬達程式片段進行聚類。這個 BEK 是基於在學習到的潛在世界模型 Mφ 中執行動作的結果。
在清醒階段,系統從受 Hindley–Milner 類型系統啟發的詞彙中生成型態化的 lambda 項(簡單、結構化的程式)。這些 lambda 項隨後由一個受程式庫條件限制的整流流動作解碼器用於產生動作。只有通過最小描述長度(MDL)準則和回傳保留閘門的抽象概念才被接受為技能。
為了訓練 REFACTOR-VLA,我們採用了三階段排程:
第一階段(世界模型暖身):訓練潛在世界模型 Mφ。
第二階段(清醒階段策略優化):優化使用技能程式庫的策略。
第三階段(睡眠階段技能發現):系統將動作片段聚類成可重複使用的技能。
我們在完整的 LIBERO 基準測試套件上評估了 REFACTOR-VLA。我們的結果顯示了兩個主要發現。首先,單純增加世界模型的大小——從 1.88 億個參數增加到 4.3 億個參數——在四個基準測試套件中有四個表現惡化,這駁斥了僅僅讓世界模型更大總是有幫助的觀點。
其次,改變訓練目標會產生巨大影響:在世界模型暖身階段(第一階段)加入輔助監督對比損失(特別是 InfoNCE 損失),顯著提高了睡眠階段(第三階段)技能聚類的品質。我們使用 n = 3 多次種子設定下的正規化互信息(NMI)進行了測量,結果如下:
物件套件:0.462 ± 0.021
空間套件:0.867 ± 0.025
目標套件:0.915 ± 0.013
LIBERO-10 套件:0.754 ± 0.010
