Исследователи предлагают APEx, иерархическую структуру использования опыта, которая организует историю взаимодействий в траекторные воспоминания на уровне экземпляров и процедурные навыки на уровне категорий для улучшения агентов глубокого исследования.

  • Система связывает эти воспоминания через архитектуру замкнутого цикла, состоящую из модулей Executor, Distiller и Planner.
  • Эти модули оптимизируются с помощью трехэтапной чередующейся парадигмы обучения GRPO для дистилляции навыков, управляемой наградой.
  • Во время тестирования дистиллированные навыки служат процедурными априорными знаниями для адаптации онлайн-планировщика с использованием обучения с подкреплением во время тестирования, направляемого навыками.
  • Эксперименты на 7 бенчмарках показывают, что APEx превосходит GPT-5.4 на 14.7 балла и сильнейшую базовую модель с дополненной памятью на 3.0 балла.

APEx обеспечивает самосовершенствование без необходимости в истинных ответах (ground-truth) с регуляризацией выравнивания навыков для предотвращения дрейфа политики, достигая наилучших результатов на сложных вопросах.