Pesquisadores propõem a Otimização de Política Exploratória de Agentes (AXPO) para abordar a "Lacuna entre Pensamento e Ação" em modelos de visão e linguagem que exigem ferramentas externas. Essa lacuna faz com que métodos padrão de RL, como GRPO, tentem usar ferramentas apenas em ~30% dos rollouts, com altas taxas de falha suprimindo os sinais de aprendizado.

  • AXPO corrige o prefixo de pensamento e resampleia a chamada da ferramenta para subgrupos totalmente errados, combinado com seleção de prefixo baseada em incerteza.
  • Avaliado em nove benchmarks multimodais e três escalas do Qwen3-VL-Thinking.
  • SFT+AXPO supera SFT+GRPO em +1.8pp Pass@1 e +1.8pp Pass@4 na média de 8B.
  • Um modelo de 8B usando SFT+AXPO supera um modelo Base de 32B no Pass@4 com quatro vezes menos parâmetros.

Essa abordagem resolve efetivamente a assimetria estrutural entre o raciocínio interno e o uso de ferramentas, permitindo um raciocínio agêntico mais eficiente e preciso.