Investigadores de Google y varias universidades japonesas han presentado ToolGrad, un marco que invierte la tubería tradicional para generar conjuntos de datos de uso de herramientas, construyendo primero cadenas de API verificadas y luego escribiendo consultas de usuario coincidentes. Este enfoque busca eliminar la ineficiencia de los métodos basados en consultas previas que a menudo fallan durante la exploración del agente.

  • El sistema utiliza cuatro módulos en un bucle: Propositor de API, Ejecutores de API, Selector de API y Actualizador de LLM.
  • En la base de datos ToolBench, ToolGrad logró una tasa de éxito del 99.8% en comparación con el 63.8% de los métodos basados en DFS.
  • Redujo los pasos de uso de herramientas por muestra de 34.3 a 20.0 mientras aumentaba la longitud de la cadena de verdad fundamental.
  • El ajuste fino de los modelos Gemma-3 en el conjunto de datos ToolGrad-500 resultante mejoró el rendimiento en todos los tamaños de parámetros.
  • El modelo de 12B alcanzó 83.1 en el Berkeley Function Calling Leaderboard, superando a Gemini 2.5 Flash-Lite y compitiendo con modelos propietarios de vanguardia.

El marco proporciona código de código abierto, conjuntos de datos y modelos para permitir un entrenamiento más eficiente y confiable de LLMs para el uso de herramientas.