Исследователи предлагают метод Agent Explorative Policy Optimization (AXPO) для устранения «разрыва между мышлением и действием» в моделях зрения-языка, требующих внешних инструментов. Этот разрыв приводит к тому, что стандартные методы RL, такие как GRPO, пытаются использовать инструменты только в ~30% эпизодов, при этом высокие показатели неудач подавляют обучающие сигналы.
- AXPO фиксирует префикс мышления и пересобирает вызовы инструментов для подгрупп с полными ошибками, в сочетании с выбором префикса на основе неопределенности.
- Оценка проведена по девяти мультимодальным бенчмаркам и трем масштабам Qwen3-VL-Thinking.
- SFT+AXPO превосходит SFT+GRPO на +1.8pp Pass@1 и +1.8pp Pass@4 в среднем для модели 8B.
- Модель 8B, использующая SFT+AXPO, превосходит базовую модель 32B по Pass@4 при четырехкратном уменьшении количества параметров.
Этот подход эффективно решает структурную асимметрию между внутренним рассуждением и использованием инструментов, обеспечивая более эффективное и точное агентное рассуждение.