Peneliti dari Google dan beberapa universitas di Jepang telah memperkenalkan ToolGrad, sebuah kerangka kerja yang membalikkan alur tradisional untuk menghasilkan dataset penggunaan alat dengan membangun rantai API terverifikasi terlebih dahulu, lalu menulis kueri pengguna yang sesuai. Pendekatan ini bertujuan menghilangkan inefisiensi metode berbasis kueri yang sering gagal selama eksplorasi agen.

  • Sistem menggunakan empat modul secara berulang: Proposer API, Executor API, Selector API, dan Pembaruan LLM.
  • Pada database ToolBench, ToolGrad mencapai tingkat keberhasilan 99,8% dibandingkan 63,8% untuk metode berbasis DFS.
  • Jumlah langkah penggunaan alat per sampel berkurang dari 34,3 menjadi 20,0 sambil meningkatkan panjang rantai ground-truth.
  • Fine-tuning model Gemma-3 pada dataset ToolGrad-500 yang dihasilkan meningkatkan kinerja di semua ukuran parameter.
  • Model 12B mencapai skor 83,1 di Berkeley Function Calling Leaderboard, melampaui Gemini 2.5 Flash-Lite dan bersaing dengan model proprietaris terdepan.

Kerangka kerja ini menyediakan kode sumber terbuka, dataset, dan model untuk memungkinkan pelatihan LLM yang lebih efisien dan andal untuk penggunaan alat.