現代的搜尋或推薦應用程式,越來越期望能回傳一組連貫的結果,而非單一的最佳匹配。舉例來說,當使用者搜尋「露營裝備」時,他們不希望看到十種略有不同的四人帳篷。他們想要的是一套連貫且互補的清單,包含帳篷、睡袋、攜帶式爐具和頭燈等基本露營用品。
為此,系統會使用一種查詢扇出(query fan-out)技術,將一個廣泛的提示詞分解成幾個相關的子查詢,以涵蓋潛在的使用者興趣。然而,教導 LLM 動態執行資料庫感知查詢分解(database-aware query decomposition)會耗費大量的思考預算。
零樣本 LLM 在設計上是通用的自迴歸文字預測器,它們並未針對目標語料庫的特定幾何流形進行優化。因此,它們需要額外的推論時計算,才能回傳一組優化高階集合級別屬性(例如多樣性、覆蓋率、互補性、連貫性)且與固定資料庫保持接地(grounded)的結果。
在我們 ICML 2026 的論文「透過 RL 編譯擴散實現高效、屬性對齊的扇出檢索」(Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion)中,我們透過一種獎勵到資料編譯框架(reward-to-data compilation framework)來解決這個分解瓶頸。
我們的 Retrieve-for-Train 框架並非強迫模型在推論時耗費大量思考預算,而是使用離線強化學習(RL)來發現與獎勵對齊的扇出,並將其編譯成監督訊號。透過將這些優化的探索行為蒸餾到一個輕量級的擴散式檢索器中,我們得以在推論時實現高效的單次查詢扇出。
這項技術在沒有推論時思考代幣(test-time thinking tokens)開銷的情況下,達成了數學上公式化的集合級別屬性。
當需要發想一組複雜的搜尋詞時,人們很可能會直接在推論時部署一個標準的現成 LLM 來完成這項工作。然而,依賴通用模型進行資料庫感知查詢分解會帶來兩個關鍵挑戰:
轉述崩潰(Paraphrastic collapse):如果沒有資料庫感知優化,零樣本 LLM 經常會遭受轉述崩潰的困擾。它們傾向於生成冗餘、近義的查詢,而非探索主題的互補面向。例如,給定廣泛的提示詞「波希米亞音樂節風格」,一個未經仔細提示工程的標準 LLM 可能會懶散地生成「bohemian festival fashion」和「bohemian festival clothes」。
這種語義循環會產生同質化的結果清單,完全錯過了時尚專家會識別出的獨特且有用的語義方向,例如流蘇夾克、鉤針洋裝或麂皮靴。
自迴歸延遲瓶頸(Autoregressive latency bottlenecks):標準 LLM 根本上受限於序列式的自迴歸生成。為了成功地將複雜查詢分解為互補的面向,現代模型通常需要大量的思考預算,生成數百個中間的思維鏈(CoT)推理代幣(即 AI 模型在回答複雜問題前生成的內部處理步驟),以規劃其擴展,然後才輸出實際的搜尋詞。
雖然這種深思熟慮的推理對於對話式 AI 來說可以接受,但對於集合值搜尋(set-valued search)(例如檢索一組互補的結果,如上述的流蘇夾克或鉤針洋裝)來說,它引入了嚴重的結構性瓶頸。當系統必須同時發想大量子查詢時,連續上下文處理和生成擴展推理代幣的綜合開銷會導致擴展性不佳。
即使採用了先進的服務優化,這種逐代幣的架構仍會產生一個延遲下限,這與生產級搜尋欄所需的亞秒級回應時間根本上是矛盾的。
Retrieve-for-Train 將 AI 的訓練視為一次離線練習,而非使用者等待時必須即時進行的測試。Retrieve-for-Train 不再強迫 AI 每次輸入查詢時都緩慢地摸索良好搜尋的規則並耗盡大量的處理預算,而是執行一次離線 RL 訓練程式。
這個程式使用嚴格的獎勵系統,將「確保結果多樣且實際有庫存」等抽象目標,轉化為精確的逐步操作手冊。一旦手冊建立完成,AI 就能在實際搜尋中立即執行,而不會有任何延遲。
該流程分為三個不同的步驟:
扇出語言模型訓練:RL 訓練一個扇出語言模型,使其能發出由集合級別屬性檢查獎勵評分的屬性對齊子查詢。這會整體評估整組結果,而非單獨評估每個結果。
監督訊號合成:凍結的扇出語言模型完全離線地合成(查詢 → 目標集合)對,用於監督式學習,無需人工標籤。
擴散式檢索器訓練:一個緊湊的 53.9M 參數擴散模型學習將查詢嵌入直接映射到一組完整的目標嵌入,並在單次非自迴歸傳遞中完成,正式繞過了對基於文字的 CoT 推理代幣的需求。
Retrieve-for-Train 框架的成功完全取決於我們如何定義「良好」的搜尋行為。傳統的監督式訓練透過學習排序(learning to rank)來評估點式相關性(pointwise relevance),單獨評分每個檢索到的項目。然而,一個真正專業的搜尋結果清單是由不可分解的集合級別屬性所定義的。你無法衡量單一項目的多樣性或互補性;這些屬性只有在評估整個檢索結果集合時才在數學上存在。
Retrieve-for-Train 並非依賴模糊的自然語言指令來強制執行這些扇出屬性,而是透過強化學習,使用嚴格的數學複合獎勵(composite reward)來微調 4B 的開源語言模型(Gemma3-4B 和 Qwen3-4B)。對於我們的開放式抽象檢索任務,這個複合獎勵是三個相互競爭的支柱的加權平衡:
接地性(Groundedness):懲罰與資料庫流形(database manifold)的距離,確保每個生成的子查詢都對應到資料庫中真實、可檢索的項目。
多樣性(Diversity):使用 Vendi Score 衡量整個子查詢集合,迫使模型探索廣泛的語義廣度。
對齊性(Alignment):將候選子查詢錨定到原始的廣泛提示詞,以防止語義漂移。
在訓練期間,我們使用群組相對策略優化(GRPO)結合軟近端策略優化(PPO),針對這些幾何現實來優化扇出語言模型。
這組特定的三元獎勵至關重要,因為它們充當相互反錨點(mutual counter-anchors)。如果模型純粹為接地性進行優化,它將透過生成退化、無意義的字串來「獎勵作弊」(reward-hack)系統,這些字串恰好在數學上映射到特定的資料庫座標。如果加入對齊性來修正這些無意義的內容,策略則會簡單地透過重複轉述使用者的提示詞來作弊。
透過注入 Vendi Score 作為反錨點,Retrieve-for-Train 有效地堵住了這些捷徑解決方案。為了達到高獎勵狀態,策略被迫進入嵌入空間(embedding space)的一個平衡區域,在那裡它必須發現有效、嚴格接地但語義上與原始意圖不同的變體。
為了評估 Retrieve-for-Train 框架,我們結合使用了凍結的、特定於資料集的多模態嵌入骨幹(multimodal embedding backbones)和為查詢擴展(query expansion)優化的開源語言模型。我們在兩種不同的集合值檢索機制下評估了這個設定:
開放式抽象檢索(Open-ended abstract retrieval):在此設定中,不存在唯一的真實值,品質完全由集合級別屬性衡量,包括多樣性、查詢對齊性和資料庫接地性。
弱監督組合檢索(Weakly supervised compositional retrieval):在此設定中,查詢與一個弱參考集配對,該參考集僅作為查詢意圖的一種可能實現。
對於多模態嵌入骨幹,我們在兩個領域進行了實驗:一個用於文字轉圖像實驗的使用者策劃服裝的大規模時尚資料集(使用基於 CLIP 的檢索器評估),以及一個用於文字轉音樂評估的專家生成音樂播放列表的專有工業資料集(使用 MuLan 評估)。
對於語言模型,查詢扇出過程由 4B 的開源模型驅動,特別是 Gemma3-4B 和 Qwen3-4B,它們的任務是為每個處理的主搜尋提示詞精確生成 10 個子查詢。我們透過 Soft-GRPO 實施了這些扇出模型的 RL 訓練,這是一種使用群組相對策略優化(group relative policy optimization)與軟 PPO 正則化的方法。
在這兩項檢索任務中,Retrieve-for-Train 的表現優於傳統的單一查詢搜尋、零樣本擴展,甚至超越了經過高度優化的 Best-of-N 基線。
在定性方面,零樣本 LLM 基線傾向於生成近義的轉述(例如,「bohemian festival style」與「bohemian festival fashion」),導致結果冗餘。Retrieve-for-Train 生成了高度多樣、獨特的子查詢(例如,分支到「靴子」或「蕾絲」),並且嚴格地保持在資料庫流形內。
直接部署我們經 RL 微調的語言模型雖然產生了卓越的搜尋品質,但它繼承了標準的自迴歸延遲限制,並需要高昂的計算思考預算。
透過將這種學習到的行為蒸餾到 53.9M 參數的 Retrieve-for-Train 擴散模型中,我們成功打破了延遲瓶頸。由於擴散模型在連續嵌入空間中以單次非自迴歸平行傳遞的方式同時生成所有目標方向,它比自迴歸方法提供了高達 12 到 20 倍的速度提升。
在大規模應用中,當自迴歸扇出在大型上下文批次下延遲線性擴展到近 50 秒時,Retrieve-for-Train-Diffusion 則保持在亞秒到幾秒之間,以極低的計算成本提供生產級的專家級搜尋。
在我們的獎勵優化過程中,我們發現了訓練用於搜尋的扇出語言模型的一些基本原理。如果沒有多樣性項,模型會迅速崩潰,生成退化、無意義的字串(例如「lin」)。
