評估使用外部工具的 AI 代理需要真實的測試情境,以捕捉開發者如何組合工具並在多輪對話中進行迭代。手動建構這類情境需要深厚的領域專業知識,難以擴展到不同的工具生態系統,並且會產生無法追蹤不斷演進 API 的靜態基準。

我們觀察到,工具規格——包括函數名稱、自然語言描述和類型化參數架構——本身就已包含足夠的語義資訊,足以合成真實的評估情境,而無需人工策劃或實際執行工具。

Agent Seer 正是基於這些潛在資訊而建構:它僅需單一的 Model Context Protocol (MCP) 規格,無需任何範例、即時工具存取或領域特定微調。

這個管道能豐富原始架構、生成帶有合成工具輸出的分級情境,並將其擴展為基於模擬數據的多輪對話。這些對話展現出強大的工具呼叫正確性和對話連貫性。

我們將此管道應用於七個涵蓋不同領域和工具套件規模的 MCP 規格進行評估,並測量其工具呼叫正確性和對話連貫性。該管道在所有領域都取得了優異的品質,並在小型和中型規格上實現了完整的工具覆蓋。

分析中浮現了兩項發現:參數架構複雜度是品質變化的最強相關因素——工具套件規模扮演著較小且獨立的角色;而參數值準確性是情境不完美時的主要失敗模式,這是粗粒度名稱匹配指標無法察覺的子維度。

多工具整合推理使由大型語言模型(LLM)驅動的工具使用代理能夠透過自然語言推理與外部工具呼叫的交錯來解決複雜任務。然而,使用僅基於結果的獎勵來訓練這類代理,會面臨歸因模糊的問題,模糊了哪些中間步驟(或工具使用決策)導致成功或失敗。

在本文中,我們提出 PORTool,這是一種具備重要性感知能力的策略優化演算法,旨在解決上述問題。這篇論文已被 ACL 2026 的第五屆自然語言生成、評估與指標研討會接受。

工具呼叫代理的評估標準包括工具選擇、參數準確性和範圍識別,然而 LLM 軌跡評估本質上是事後進行的。這類評估與實際執行循環脫節,識別出的錯誤通常透過提示詞微調或重新訓練來解決,但從根本上無法在即時執行中提供反饋。