Исследователи из Google и нескольких японских университетов представили ToolGrad, фреймворк, который инвертирует традиционный конвейер генерации наборов данных для использования инструментов: сначала создаются проверенные цепочки вызовов API, а затем пишутся соответствующие пользовательские запросы. Этот подход направлен на устранение неэффективности методов, основанных на первоочередном формировании запросов, которые часто терпят неудачу при исследовании агентами.

  • Система использует четыре модуля в цикле: API Proposer, API Executors, API Selector и LLM Updater.
  • На базе данных ToolBench ToolGrad достигла 99.8% успешности по сравнению с 63.8% для методов на основе DFS.
  • Количество шагов использования инструмента на образец было сокращено с 34.3 до 20.0 при увеличении длины цепочки ground-truth.
  • Дообучение моделей Gemma-3 на полученном наборе данных ToolGrad-500 улучшило производительность для всех размеров параметров.
  • Модель 12B достигла 83.1 в Berkeley Function Calling Leaderboard, превзойдя Gemini 2.5 Flash-Lite и конкурируя с передовыми проприетарными моделями.

Фреймворк предоставляет открытый исходный код, наборы данных и модели для более эффективного и надежного обучения LLM использованию инструментов.