研究人员提出代理探索策略优化(AXPO),以解决视觉语言模型在需要外部工具时存在的“思考-行动差距”。这一差距导致GRPO等标准强化学习方法仅在约30%的 rollout 中尝试使用工具,且高失败率抑制了学习信号。
- AXPO修复思考前缀,并为全错子组重采样工具调用,结合基于不确定性的前缀选择。
- 在九个多模态基准和三个规模的Qwen3-VL-Thinking上进行评估。
- SFT+AXPO在8B规模上平均比SFT+GRPO提升1.8pp的Pass@1和1.8pp的Pass@4。
- 使用SFT+AXPO的8B模型在Pass@4指标上超越32B基础模型,参数量减少四倍。
该方法有效解决了内部推理与工具使用之间的结构性不对称,实现了更高效、更准确的智能体推理。