ToolGrad:用文本"梯度"高效生成工具使用数据集
AI Agent 在自动化真实任务方面展现了巨大潜力,例如执行 Google 搜索、读取本地文件、运行生成的 Python 脚本。要实现这类 agentic workflow,LLM 需要学会正确且高效地调用工具。而要教会 LLM 使用工具,我们需要工具调用链及其对应用户查询的数据集。在 InstructPipe 中,我们手动标注了评测数据,但对于更高级的 LLM 微调流程,人工标注难以规模化。为简化数据流程,ToolBench、ToolACE 等先行工作探索了用 Agent 通过试错自动搜索工具调用路径。这类标注方法包含两步:(1) 从采样的 API 池中生成假设的用户指令;(2) 用深度优先搜索(DFS)Agent 寻找对应的工具调用解。这种方法本质效率不高,因为它的核心是从复杂的 Agent 探索中提炼有价值轨迹来训练 LLM。
在 ACL 2026 发表的"ToolGrad: Efficient Tool-use Dataset Generation with Textual 'Gradients'"中,我们提出了另一种解法范式。ToolGrad 首先生成 ground-truth 工具调用链,再为其标注对应的用户 prompt。直觉上,显式的工具调用解比 prompt 提供的信息更明确,从工具调用反向标注用户查询要简单得多,且只需一步 LLM 调用。实验结果表明,这种"答案优先"的方法能以更低成本生成更复杂(长程)的工具调用数据。用我们生成的数据训练的 LLM 也优于基线方法训练的结果,甚至在包含未见工具的分布外(OOD)数据集上可媲美 SoTA 专有 LLM。
以往的方法通过搜索用户查询的解来生成工具使用数据集,通过率很低;而 ToolGrad 先生成成功的工具使用链,再生成提示词,因此获得了很高的通过率。
利用文本“梯度”迭代生成工具使用链
标准的机器学习(ML)系统通过在小批量训练样本上计算数值损失梯度来不断改进,优化算法再据此更新模型权重。最近,TextGrad 将这一范式引入提示词工程,用 LLM 评审器给出丰富的纯文字描述性反馈——这类反馈被称为“文本梯度”。这些文本梯度随后指导对原提示词的修改,生成能更好完成目标任务的改进版本。
ToolGrad 把文本梯度的概念从提示词优化迁移到了合成数据集的生成上。它优化的不是静态的文本提示词,而是借助这些梯度,从庞大的工具库中迭代构建出复杂且有效的 API 工作流。
将 ToolGrad 的优化组件与传统 ML 和 TextGrad 进行对比。
ToolGrad 框架
ToolGrad 包含四个核心模块,依次执行提出、执行、选择和更新。
- API 提出器:在每轮迭代中,该模块从采样得到的 API 集合中筛选出少数最有希望的候选,用于扩展当前工作流。
- API 执行器:并行测试选中的 API,并生成详细的执行报告。
- API 选择器:审阅执行报告,选出表现最佳的单一 API 调用——它充当文本梯度,为改进提供方向性反馈——并将其追加到工作流中。
- LLM 更新器:最后,该模块根据新增的 API 集合,修订合成的用户查询和 AI 回复。
反复执行这一迭代流程后,最终得到一条数据样本,包含用户查询、经验证的 API 工作流以及 AI 的最终回复。
ToolGrad 先生成成功的工具调用链,再生成提示词,因此通过率很高。
实验
数据生成效率
我们先评估数据生成的成本与质量。以 ToolBench 作为 API 数据库(包含 16,000 多个真实 API)来生成工具调用数据集,并将 ToolBench 原有的"查询优先"生成方式(基于深度优先搜索 DFS)与我们的"答案优先"方式 ToolGrad 进行对比。结果表明,ToolGrad 以更低的生成成本产出更复杂的工具调用数据,且通过率更高。
查询优先方式(基线)与答案优先方式(本文方法)的生成效率对比。
伯克利函数调用排行榜
我们基于 ToolBench 的 API 数据库生成了小规模工具调用数据集 ToolGrad-500,并用它对 Gemma-3 模型(1B、4B 和 12B)进行微调,分别命名为 ToolGrad-1B、ToolGrad-4B 和 ToolGrad-12B。随后在 Berkeley Function Calling Leaderboard(BFCL)上评估这些模型的工具调用性能,该基准使用与 ToolBench 不同的工具集。我们将微调后的模型与以下三类进行对比:(1) 未微调的基础模型;(2) 最领先的专有模型(Gemini、GPT、Claude);(3) 最领先的工具调用专用模型(ToolACE、Hammer-2.1-7B)。
以下是我们的主要发现。
- 对基线模型的持续提升:在 ToolGrad-500 上对 Gemma-3 进行后训练,在所有测试的参数规模下均能显著增强工具调用性能。
- 超越闭源大模型:ToolGrad-12B 以 83.1 分展现出卓越能力,与发布时行业最先进的闭源模型高度竞争,包括 gemini-2.5-pro(83.2)、claude-4.5 Opus(82.8)以及 gpt-5(74.4)。
- 自我进化:ToolGrad-500 数据集由 gemini-2.5-flash-lite 生成。有趣的是,我们发现用 gemini-2.5-flash-lite 生成的数据微调 Gemma-3-12B 后,其表现甚至超越了原本的"教师模型"。
- 超越其他开源模型:相比其他开源工具调用专用模型(包括在更高级 API 数据库上微调的 ToolACE),ToolGrad-12B 展现出明显领先优势。
Gemma-3、ToolGrad 系列模型、Gemini 2.5 系列、GPT-5、Claude-4.5、ToolACE 及 Hammer-2.1-7B 在 BFCL 基准上的评测结果。
总结与未来方向
ToolGrad 证明,通过"先答后问"范式可以更高效、更可靠地生成高质量工具调用数据集。通过设计一个以文本梯度迭代串联 API 的 agentic 框架,ToolGrad 解决了生成标注数据时长期存在的成本与可扩展性瓶颈。我们的设计在数据生成中实现了接近 100% 的通过率,使较小规模的模型也能表现出色,并表明"学生"模型甚至能超越"教师"模型。
展望未来,将框架扩展至日益动态且庞大的 API 生态系统,即可将该研究应用于更广泛的实际场景。后续工作还将探索将这种自我进化能力延伸至持续、即时的个性化学习。随着 agentic 工作流越来越多地融入企业与日常任务,ToolGrad 等框架为训练既能力强、又具备经济可扩展性的数字智能体奠定了基础。
致谢
这项研究主要由钟毅舟(Zhongyi Zhou)在 Google 担任访问研究员期间完成。我们衷心感谢主要贡献者 Kohei Uehara、Haoyu Zhang、Jingtao Zhou、Lin Gu、Zheng Xu、Tatsuya Harada 的支持,也感谢 Adarsh Kowdle 和 Shahram Izadi 提供的战略指导和细致审阅。