قدم باحثون من جوجل وعدة جامعات يابانية إطار عمل ToolGrad، الذي يعكس خط الأنابيب التقليدي لتوليد مجموعات بيانات استخدام الأدوات من خلال بناء سلاسل واجهات برمجة التطبيقات (API) المُتحقق منها أولاً ثم كتابة استعلامات المستخدم المطابقة لها. تهدف هذه الطريقة إلى القضاء على عدم كفاءة الأساليب القائمة على الاستعلام أولاً والتي غالباً ما تفشل أثناء استكشاف الوكيل.
- يستخدم النظام أربعة وحدات في حلقة مغلقة: مقترح واجهة برمجة التطبيقات (API Proposer)، ومنفذو واجهات برمجة التطبيقات (API Executors)، ومحدد واجهة برمجة التطبيقات (API Selector)، ومحدث النموذج اللغوي الكبير (LLM Updater).
- على قاعدة بيانات ToolBench، حقق ToolGrad معدل نجاح بنسبة 99.8% مقارنة بـ 63.8% للأساليب القائمة على البحث بالعمق أولاً (DFS).
- قلل عدد خطوات استخدام الأدوات لكل عينة من 34.3 إلى 20.0 مع زيادة طول سلسلة الحقيقة الأرضية.
- أدى ضبط نماذج Gemma-3 الدقيق على مجموعة بيانات ToolGrad-500 الناتجة إلى تحسين الأداء عبر جميع أحجام المعاملات.
- وصل النموذج بحجم 12 مليار معامل إلى درجة 83.1 على لوحة المتصدرين لاستدعاء الوظائف من بيركلي، متفوقاً على Gemini 2.5 Flash-Lite ومتنافساً مع النماذج الخاصة الرائدة.
يوفر هذا الإطار شفرة المصدر مفتوحة، ومجموعات البيانات، والنماذج لتمكين تدريب أكثر كفاءة وموثوقية للنماذج اللغوية الكبيرة لاستخدام الأدوات.