来自Google和几所日本大学的研究人员推出了ToolGrad,该框架通过先构建经过验证的API链,再编写匹配的用户查询,从而逆转了传统工具使用数据集生成的流程。这种方法旨在消除基于查询优先的方法在智能体探索过程中经常出现的低效问题。

  • 该系统以循环方式使用四个模块:API Proposer、API Executors、API Selector和LLM Updater。
  • 在ToolBench数据库上,ToolGrad的通过率达到99.8%,而基于DFS的方法仅为63.8%。
  • 它将每个样本的工具使用步骤从34.3减少到20.0,同时增加了真实链的长度。
  • 在生成的ToolGrad-500数据集上微调Gemma-3模型,提升了所有参数规模的性能。
  • 12B模型在Berkeley Function Calling Leaderboard上达到83.1分,超越了Gemini 2.5 Flash-Lite,并与前沿专有模型竞争。

该框架提供了开源代码、数据集和模型,以实现更高效、更可靠的LLM工具使用训练。