Исследователи предлагают APEx, иерархическую систему использования опыта, предназначенную для улучшения агентов глубокого исследования, отвечающих на сложные вопросы с использованием внешних инструментов. Система организует историю взаимодействий в траекторные воспоминания уровня экземпляра и процедурные навыки уровня категории, связывая их через архитектуру Executor, Distiller и Planner.

  • Оптимизирована с помощью трехэтапной чередующейся парадигмы обучения GRPO для дистилляции навыков, направляемых наградой.
  • Использует дистиллированные навыки в качестве процедурных априорных знаний для адаптации онлайн-планировщика через обучение с подкреплением во время тестирования, направляемое навыками.
  • Достижение состояния искусства на 7 бенчмарках, превосходя GPT-5.4 на 14.7 балла и сильнейшую базовую модель с дополненной памятью на 3.0 балла.

APEx обеспечивает самосовершенствование без ground-truth с регуляризацией выравнивания навыков для предотвращения дрейфа политики во время тестирования.