Des chercheurs de Google et de plusieurs universités japonaises ont présenté ToolGrad, un cadre qui inverse le pipeline traditionnel de génération de jeux de données pour l'utilisation d'outils en construisant d'abord des chaînes d'API vérifiées, puis en rédigeant les requêtes utilisateur correspondantes. Cette approche vise à éliminer l'inefficacité des méthodes axées sur la requête qui échouent souvent lors de l'exploration par les agents.
- Le système utilise quatre modules en boucle : API Proposer, API Executors, API Selector et LLM Updater.
- Sur la base de données ToolBench, ToolGrad a obtenu un taux de réussite de 99,8 % contre 63,8 % pour les méthodes basées sur DFS.
- Il a réduit le nombre d'étapes d'utilisation d'outils par échantillon de 34,3 à 20,0 tout en augmentant la longueur de la chaîne de vérité terrain.
- Le fine-tuning des modèles Gemma-3 sur le jeu de données ToolGrad-500 résultant a amélioré les performances pour toutes les tailles de paramètres.
- Le modèle 12B a atteint 83,1 sur le Berkeley Function Calling Leaderboard, surpassant Gemini 2.5 Flash-Lite et rivalisant avec des modèles propriétaires de pointe.
Le cadre fournit du code open-source, des jeux de données et des modèles pour permettre un entraînement plus efficace et fiable des LLMs pour l'utilisation d'outils.