يقترح الباحثون تحسين سياسة الاستكشاف الوكيل (AXPO) لمعالجة "فجوة التفكير-التنفيذ" في نماذج اللغة والرؤية التي تتطلب أدوات خارجية. تسبب هذه الفجوة في محاولة طرق التعزيز المعيارية مثل GRPO استخدام الأدوات في حوالي 30% فقط من عمليات الرولأوت، مع كبت إشارات التعلم بسبب معدلات الفشل العالية.
- يصحّح AXPO بادئة التفكير ويعيد أخذ العينات لاستدعاء الأداة لجميع المجموعات الفرعية الخاطئة تماماً، مقترناً باختيار البادئة القائم على عدم اليقين.
- تم التقييم عبر تسعة معايير متعددة الوسائط وثلاث مقاييس من Qwen3-VL-Thinking.
- يتفوق SFT+AXPO على SFT+GRPO بزيادة قدرها +1.8 نقطة مئوية في Pass@1 و+1.8 نقطة مئوية في Pass@4 بمعدل 8B.
- يتجاوز نموذج بحجم 8B يستخدم SFT+AXPO نموذج الأساس بحجم 32B في Pass@4 بأربعة أضعاف عدد المعلمات الأقل.
يحلّ هذا النهج بنجاح عدم التماثل الهيكلي بين الاستدلال الداخلي واستخدام الأدوات، مما يتيح استدلالاً وكيلياً أكثر كفاءة ودقة.