Investigadores de Google y varias universidades japonesas han presentado ToolGrad, un marco que invierte la tubería tradicional para generar conjuntos de datos de uso de herramientas, construyendo primero cadenas de API verificadas y luego escribiendo consultas de usuario coincidentes. Este enfoque busca eliminar la ineficiencia de los métodos basados en consultas previas que a menudo fallan durante la exploración del agente.
- El sistema utiliza cuatro módulos en un bucle: Propositor de API, Ejecutores de API, Selector de API y Actualizador de LLM.
- En la base de datos ToolBench, ToolGrad logró una tasa de éxito del 99.8% en comparación con el 63.8% de los métodos basados en DFS.
- Redujo los pasos de uso de herramientas por muestra de 34.3 a 20.0 mientras aumentaba la longitud de la cadena de verdad fundamental.
- El ajuste fino de los modelos Gemma-3 en el conjunto de datos ToolGrad-500 resultante mejoró el rendimiento en todos los tamaños de parámetros.
- El modelo de 12B alcanzó 83.1 en el Berkeley Function Calling Leaderboard, superando a Gemini 2.5 Flash-Lite y compitiendo con modelos propietarios de vanguardia.
El marco proporciona código de código abierto, conjuntos de datos y modelos para permitir un entrenamiento más eficiente y confiable de LLMs para el uso de herramientas.