Los investigadores proponen la Optimización Exploratoria de Políticas de Agentes (AXPO) para abordar la "brecha entre pensar y actuar" en modelos de visión y lenguaje que requieren herramientas externas. Esta brecha hace que los métodos estándar de RL como GRPO intenten usar herramientas solo en ~30% de las trayectorias, con altas tasas de fallo que suprimen las señales de aprendizaje.

  • AXPO fija el prefijo de pensamiento y vuelve a muestrear la llamada a la herramienta para subgrupos completamente erróneos, junto con la selección de prefijos basada en incertidumbre.
  • Evaluado en nueve benchmarks multimodales y tres escalas de Qwen3-VL-Thinking.
  • SFT+AXPO supera a SFT+GRPO en +1.8pp Pass@1 y +1.8pp Pass@4 en promedio con 8B.
  • Un modelo de 8B que usa SFT+AXPO supera a un modelo Base de 32B en Pass@4 con cuatro veces menos parámetros.

Este enfoque resuelve eficazmente la asimetría estructural entre el razonamiento interno y el uso de herramientas, permitiendo un razonamiento agénico más eficiente y preciso.