연구자들은 외부 도구가 필요한 비전-언어 모델의 "사고-행동 간극"을 해결하기 위해 에이전트 탐색 정책 최적화(AXPO)를 제안합니다. 이 간극으로 인해 GRPO와 같은 표준 RL 방법은 롤아웃의 약 30%에서만 도구 사용을 시도하며, 높은 실패율이 학습 신호를 억제합니다.

  • AXPO는 사고 접두사를 고정하고 불일치 하위 그룹에 대해 도구 호출을 재샘플링하며, 불확실성 기반 접두사 선택과 결합됩니다.
  • 9개의 다중모달 벤치마크와 Qwen3-VL-Thinking의 세 가지 규모에서 평가되었습니다.
  • SFT+AXPO는 8B 모델에서 평균적으로 SFT+GRPO 대비 Pass@1 기준 +1.8pp, Pass@4 기준 +1.8pp 더 높은 성능을 보입니다.
  • SFT+AXPO를 사용하는 8B 모델은 파라미터 수를 4분의 1로 줄인 상태에서 32B 베이스 모델보다 Pass@4에서 더 우수한 성능을 달성합니다.

이 접근 방식은 내부 추론과 도구 사용 간의 구조적 비대칭성을 효과적으로 해결하여, 더 효율적이고 정확한 에이전트 추론을 가능하게 합니다.