← 文章 / AI技术
Google Research 博客 4小时前 · 2026-09-11 07:09:50 · 2 阅读

ToolGrad:用文本"梯度"高效生成工具使用数据集

AI Agent 在自动化真实任务方面展现了巨大潜力,例如执行 Google 搜索、读取本地文件、运行生成的 Python 脚本。要实现这类 agentic workflow,LLM 需要学会正确且高效地调用工具。而要教会 LLM 使用工具,我们需要工具调用链及其对应用户查询的数据集。在 InstructPipe 中,我们手动标注了评测数据,但对于更高级的 LLM 微调流程,人工标注难以规模化。为简化数据流程,ToolBenchToolACE 等先行工作探索了用 Agent 通过试错自动搜索工具调用路径。这类标注方法包含两步:(1) 从采样的 API 池中生成假设的用户指令;(2) 用深度优先搜索(DFS)Agent 寻找对应的工具调用解。这种方法本质效率不高,因为它的核心是从复杂的 Agent 探索中提炼有价值轨迹来训练 LLM。

ACL 2026 发表的"ToolGrad: Efficient Tool-use Dataset Generation with Textual 'Gradients'"中,我们提出了另一种解法范式。ToolGrad 首先生成 ground-truth 工具调用链,再为其标注对应的用户 prompt。直觉上,显式的工具调用解比 prompt 提供的信息更明确,从工具调用反向标注用户查询要简单得多,且只需一步 LLM 调用。实验结果表明,这种"答案优先"的方法能以更低成本生成更复杂(长程)的工具调用数据。用我们生成的数据训练的 LLM 也优于基线方法训练的结果,甚至在包含未见工具的分布外(OOD)数据集上可媲美 SoTA 专有 LLM。

图表展示 ToolGrad 的顺序式 API 小批量方法实现了很高的标注通过率,而此前的方法则以失败告终。

以往的方法通过搜索用户查询的解来生成工具使用数据集,通过率很低;而 ToolGrad 先生成成功的工具使用链,再生成提示词,因此获得了很高的通过率。

利用文本“梯度”迭代生成工具使用链

标准的机器学习(ML)系统通过在小批量训练样本上计算数值损失梯度来不断改进,优化算法再据此更新模型权重。最近,TextGrad 将这一范式引入提示词工程,用 LLM 评审器给出丰富的纯文字描述性反馈——这类反馈被称为“文本梯度”。这些文本梯度随后指导对原提示词的修改,生成能更好完成目标任务的改进版本。

ToolGrad 把文本梯度的概念从提示词优化迁移到了合成数据集的生成上。它优化的不是静态的文本提示词,而是借助这些梯度,从庞大的工具库中迭代构建出复杂且有效的 API 工作流。

表格从四个关键维度比较机器学习、TextGrad 和 ToolGrad 的优化组件。

将 ToolGrad 的优化组件与传统 ML 和 TextGrad 进行对比。

ToolGrad 框架

ToolGrad 包含四个核心模块,依次执行提出、执行、选择和更新。

  1. API 提出器:在每轮迭代中,该模块从采样得到的 API 集合中筛选出少数最有希望的候选,用于扩展当前工作流。
  2. API 执行器:并行测试选中的 API,并生成详细的执行报告。
  3. API 选择器:审阅执行报告,选出表现最佳的单一 API 调用——它充当文本梯度,为改进提供方向性反馈——并将其追加到工作流中。
  4. LLM 更新器:最后,该模块根据新增的 API 集合,修订合成的用户查询和 AI 回复。

反复执行这一迭代流程后,最终得到一条数据样本,包含用户查询、经验证的 API 工作流以及 AI 的最终回复。

A flowchart illustrating the ToolGrad workflow, where APIs are proposed, evaluated, and sequentially integrated to update a query and workflow.

ToolGrad 先生成成功的工具调用链,再生成提示词,因此通过率很高。

实验

数据生成效率

我们先评估数据生成的成本与质量。以 ToolBench 作为 API 数据库(包含 16,000 多个真实 API)来生成工具调用数据集,并将 ToolBench 原有的"查询优先"生成方式(基于深度优先搜索 DFS)与我们的"答案优先"方式 ToolGrad 进行对比。结果表明,ToolGrad 以更低的生成成本产出更复杂的工具调用数据,且通过率更高。

A table showing ToolGrad outperforming ToolBench by achieving a 99.8 percent pass rate with fewer optimization steps.

查询优先方式(基线)与答案优先方式(本文方法)的生成效率对比。

伯克利函数调用排行榜

我们基于 ToolBench 的 API 数据库生成了小规模工具调用数据集 ToolGrad-500,并用它对 Gemma-3 模型(1B、4B 和 12B)进行微调,分别命名为 ToolGrad-1B、ToolGrad-4B 和 ToolGrad-12B。随后在 Berkeley Function Calling Leaderboard(BFCL)上评估这些模型的工具调用性能,该基准使用与 ToolBench 不同的工具集。我们将微调后的模型与以下三类进行对比:(1) 未微调的基础模型;(2) 最领先的专有模型(Gemini、GPT、Claude);(3) 最领先的工具调用专用模型(ToolACE、Hammer-2.1-7B)。

以下是我们的主要发现。

  • 对基线模型的持续提升:在 ToolGrad-500 上对 Gemma-3 进行后训练,在所有测试的参数规模下均能显著增强工具调用性能。
  • 超越闭源大模型:ToolGrad-12B 以 83.1 分展现出卓越能力,与发布时行业最先进的闭源模型高度竞争,包括 gemini-2.5-pro(83.2)、claude-4.5 Opus(82.8)以及 gpt-5(74.4)。
  • 自我进化:ToolGrad-500 数据集由 gemini-2.5-flash-lite 生成。有趣的是,我们发现用 gemini-2.5-flash-lite 生成的数据微调 Gemma-3-12B 后,其表现甚至超越了原本的"教师模型"。
  • 超越其他开源模型:相比其他开源工具调用专用模型(包括在更高级 API 数据库上微调的 ToolACE),ToolGrad-12B 展现出明显领先优势。
柱状图:ToolGrad 持续提升 1B、4B、12B 基座模型在工具调用基准上的得分。

Gemma-3、ToolGrad 系列模型、Gemini 2.5 系列、GPT-5、Claude-4.5、ToolACE 及 Hammer-2.1-7B 在 BFCL 基准上的评测结果。

总结与未来方向

ToolGrad 证明,通过"先答后问"范式可以更高效、更可靠地生成高质量工具调用数据集。通过设计一个以文本梯度迭代串联 API 的 agentic 框架,ToolGrad 解决了生成标注数据时长期存在的成本与可扩展性瓶颈。我们的设计在数据生成中实现了接近 100% 的通过率,使较小规模的模型也能表现出色,并表明"学生"模型甚至能超越"教师"模型。

展望未来,将框架扩展至日益动态且庞大的 API 生态系统,即可将该研究应用于更广泛的实际场景。后续工作还将探索将这种自我进化能力延伸至持续、即时的个性化学习。随着 agentic 工作流越来越多地融入企业与日常任务,ToolGrad 等框架为训练既能力强、又具备经济可扩展性的数字智能体奠定了基础。

致谢

这项研究主要由钟毅舟(Zhongyi Zhou)在 Google 担任访问研究员期间完成。我们衷心感谢主要贡献者 Kohei Uehara、Haoyu Zhang、Jingtao Zhou、Lin Gu、Zheng Xu、Tatsuya Harada 的支持,也感谢 Adarsh Kowdle 和 Shahram Izadi 提供的战略指导和细致审阅。

原始来源: Google Research 博客

评论 (0)