Los investigadores proponen la Optimización Exploratoria de Políticas de Agentes (AXPO) para abordar la "brecha entre pensar y actuar" en modelos de visión y lenguaje que requieren herramientas externas. Esta brecha hace que los métodos estándar de RL como GRPO intenten usar herramientas solo en ~30% de las trayectorias, con altas tasas de fallo que suprimen las señales de aprendizaje.
- AXPO fija el prefijo de pensamiento y vuelve a muestrear la llamada a la herramienta para subgrupos completamente erróneos, junto con la selección de prefijos basada en incertidumbre.
- Evaluado en nueve benchmarks multimodales y tres escalas de Qwen3-VL-Thinking.
- SFT+AXPO supera a SFT+GRPO en +1.8pp Pass@1 y +1.8pp Pass@4 en promedio con 8B.
- Un modelo de 8B que usa SFT+AXPO supera a un modelo Base de 32B en Pass@4 con cuatro veces menos parámetros.
Este enfoque resuelve eficazmente la asimetría estructural entre el razonamiento interno y el uso de herramientas, permitiendo un razonamiento agénico más eficiente y preciso.