AI 代理在自動化現實世界任務方面展現巨大潛力,例如執行 Google 搜尋、讀取本機電腦檔案或執行生成的 Python 腳本。為了實現這類代理工作流程,大型語言模型(LLM)需要學習如何正確且高效地使用工具。
為了教導 LLM 使用工具,我們需要工具使用鏈及其對應使用者查詢的資料集。在我們之前於 InstructPipe 中介紹的工作中,我們手動標註了評估資料,但對於進階的 LLM 微調工作流程而言,人工標註的擴展性不佳。
為了簡化資料工作流程,先前的研究(例如 ToolBench 和 ToolACE)探索了使用代理透過試錯法自動搜尋工具使用路徑。這種代表性的標註方法包含兩個步驟:(1) 從取樣的 API 池中生成一個假設的使用者指令,以及 (2) 使用深度優先搜尋(DFS)代理來尋找其工具使用解決方案。這種方法本質上效率低下,因為其核心概念是從複雜的代理探索中提取有價值的軌跡來訓練 LLM。
在 ACL 2026 上發表的「ToolGrad:以『文字梯度』高效生成工具使用資料集」中,我們提出了一種替代的解決方案範式。ToolGrad 首先生成一個真實的工具使用鏈,然後標註其對應的使用者提示詞。
直觀來說,一個明確的工具使用解決方案比提示詞提供了更明確的資訊,使得從工具使用到使用查詢的標註變得更容易,並且只需要一個 LLM 步驟。我們的結果顯示,這種「答案優先」的方法能以更低的成本生成更複雜(長程)的工具使用資料。
使用我們生成資料訓練的 LLM 也優於使用基準方法訓練的模型,甚至在包含未見工具的分布外(OOD)資料集上,能與最先進的專有 LLM 匹敵。
標準的機器學習(ML)系統透過計算訓練樣本小批次上的數值損失梯度來改進,這些梯度隨後被最佳化演算法用於更新模型權重。最近,TextGrad 將這種範式應用於提示詞工程,利用 LLM 評論器提供豐富、描述性的純文字回饋,這種回饋被稱為「文字梯度」。
這些文字梯度隨後引導給定提示詞的改進,使其成為一個能更好解決目標任務的新草稿。ToolGrad 將文字梯度的概念從提示詞最佳化應用到合成資料集生成。
ToolGrad 不再最佳化靜態文字提示詞,而是利用這些梯度從大型工具庫中迭代建構複雜、有效的 API 工作流程。
ToolGrad 包含四個核心模組,它們依序執行提案、執行、選擇和更新。
API 提案器(API Proposer):在每次迭代中,此模組將取樣的 API 集合縮小為幾個有潛力的候選者,以擴展當前的工作流程。
API 執行器(API Executors):這些模組並行測試選定的 API,並生成詳細的執行報告。
API 選擇器(API Selector):此模組審查執行報告,並選擇單個表現最佳的 API 呼叫,作為提供改進方向性回饋的「文字梯度」,並將其附加到工作流程中。
LLM 更新器(LLM Updater):最後,此模組修改合成的使用者查詢和 AI 回應,以匹配新的 API 集合。重複這個迭代過程,最終會產生一個包含使用者查詢、經過驗證的 API 工作流程和最終 AI 回應的資料樣本。
我們首先評估資料生成的成本和品質。我們使用 ToolBench 作為我們的 API 資料庫,它包含超過 16,000 個真實世界的 API,用於生成我們的工具使用資料集。
我們將 ToolBench 上原始的「查詢優先」資料生成方法(使用深度優先搜尋,DFS)與我們的「答案優先」方法 ToolGrad 進行比較。結果表明,ToolGrad 能以更低的生成成本,產生更複雜、通過率更高的工具使用資料。
我們使用 ToolBench 的 API 資料庫生成了名為 ToolGrad-500 的小型工具使用資料集。隨後,我們使用 ToolGrad-500 微調了 Gemma-3 模型(1B、4B 和 12B),並將這些微調後的模型命名為 ToolGrad-1B、ToolGrad-4B 和 ToolGrad-12B。
我們在 Berkeley Function Calling Leaderboard (BFCL) 上評估了這些模型的工具使用性能,BFCL 是一個與 ToolBench 具有不同工具集的工具使用基準測試。我們將微調後的模型與 (1) 未經微調的基礎模型、(2) 最先進的專有模型(Gemini、GPT 和 Claude),以及 (3) 最先進的工具使用專用模型(ToolACE、Hammer-2.1-7B)進行比較。
以下是我們的發現摘要:
對比基準模型的持續改進:在 ToolGrad-500 上訓練後的 Gemma-3 模型,在所有測試的參數規模下,其工具使用性能均顯著提升。
超越專有 LLM:ToolGrad-12B 模型展現出卓越的能力,其得分為 83.1,使其在發表時與業界最先進的專有模型 gemini-2.5-pro (83.2)、claude-4.5 Opus (82.8) 以及 gpt-5 (74.4) 具有高度競爭力。
自我演進:ToolGrad-500 資料集是使用 gemini-2.5-flash-lite 生成的。有趣的是,我們發現使用 gemini-2.5-flash-lite 生成的資料微調後的 Gemma-3-12B 能夠超越其原始的「教師模型」。
超越其他開源模型:與其他開源的工具使用專用模型相比,ToolGrad-12B 確立了明顯的領先地位,其中包括在更先進的 API 資料庫上進行微調的 ToolACE。
ToolGrad 證明了透過「答案優先」的範式,可以更高效、更可靠地生成高品質的工具使用資料集。透過設計一個代理框架,利用文字梯度迭代地串聯 API,ToolGrad 解決了生成真實資料長期存在的成本和擴展性瓶頸。
我們的設計在資料生成中實現了近 100% 的通過率,使相對緊湊的模型也能表現出色,並顯示學生 LLM 甚至可以超越其教師模型。
展望未來,這項研究可以透過擴展框架來處理日益動態和龐大的 API 生態系統,從而應用於更廣泛的現實世界應用。未來的研究也將探索擴展這種自我演進能力,以支援隨時間推移的個人化即時學習。
隨著代理工作流程日益融入企業和日常任務,像 ToolGrad 這樣的框架為訓練既高效能又具經濟擴展性的數位代理奠定了基礎。
致謝
這項研究主要由 Zhongyi Zhou 在 Google 擔任訪問研究員期間進行。我們衷心感謝主要貢獻者 Kohei Uehara、Haoyu Zhang、Jingtao Zhou、Lin Gu、Zheng Xu、Tatsuya Harada 的支持,以及 Adarsh Kowdle 和 Shahram Izadi 提供的戰略指導和深思熟慮的審閱。
