Pesquisadores do Google e de várias universidades japonesas apresentaram o ToolGrad, um framework que inverte o pipeline tradicional para a geração de conjuntos de dados de uso de ferramentas, construindo primeiro cadeias de API verificadas e, em seguida, escrevendo consultas de usuário correspondentes. Essa abordagem visa eliminar a ineficiência dos métodos baseados em consulta que frequentemente falham durante a exploração por agentes.

  • O sistema utiliza quatro módulos em um loop: Proposer de API, Executors de API, Selector de API e Atualizador de LLM.
  • No banco de dados ToolBench, o ToolGrad alcançou uma taxa de aprovação de 99,8%, comparado a 63,8% para métodos baseados em DFS.
  • Reduziu o número de etapas de uso de ferramentas por amostra de 34,3 para 20,0, ao mesmo tempo que aumentou o comprimento da cadeia de verdade fundamental (ground-truth).
  • O ajuste fino dos modelos Gemma-3 no conjunto de dados ToolGrad-500 resultante melhorou o desempenho em todos os tamanhos de parâmetros.
  • O modelo de 12B atingiu 83,1 no Berkeley Function Calling Leaderboard, superando o Gemini 2.5 Flash-Lite e competindo com modelos proprietários de ponta.

O framework fornece código de código aberto, conjuntos de dados e modelos para permitir um treinamento mais eficiente e confiável de LLMs para uso de ferramentas.