Les chercheurs proposent l'Optimisation de la Politique d'Exploration Agentique (AXPO) pour combler l'écart « Thinking-Acting Gap » dans les modèles vision-langage qui nécessitent des outils externes. Cet écart entraîne les méthodes RL standard comme GRPO à tenter d'utiliser des outils sur seulement ~30% des rollouts, avec des taux d'échec élevés qui suppriment les signaux d'apprentissage.

  • AXPO fixe le préfixe de réflexion et resample l'appel d'outil pour tous les sous-groupes incorrects, couplé à une sélection de préfixe basée sur l'incertitude.
  • Évalué sur neuf benchmarks multimodaux et trois échelles de Qwen3-VL-Thinking.
  • SFT+AXPO surpasse SFT+GRPO de +1.8pp Pass@1 et +1.8pp Pass@4 à 8B en moyenne.
  • Un modèle 8B utilisant SFT+AXPO surpasse un modèle Base 32B sur Pass@4 avec quatre fois moins de paramètres.

Cette approche résout efficacement l'asymétrie structurelle entre la réflexion interne et l'utilisation d'outils, permettant un raisonnement agentique plus efficace et précis.