Исследователи предлагают APEx, иерархическую структуру использования опыта, которая организует историю взаимодействий в траекторные воспоминания на уровне экземпляров и процедурные навыки на уровне категорий для улучшения агентов глубокого исследования.
- Система связывает эти воспоминания через архитектуру замкнутого цикла, состоящую из модулей Executor, Distiller и Planner.
- Эти модули оптимизируются с помощью трехэтапной чередующейся парадигмы обучения GRPO для дистилляции навыков, управляемой наградой.
- Во время тестирования дистиллированные навыки служат процедурными априорными знаниями для адаптации онлайн-планировщика с использованием обучения с подкреплением во время тестирования, направляемого навыками.
- Эксперименты на 7 бенчмарках показывают, что APEx превосходит GPT-5.4 на 14.7 балла и сильнейшую базовую модель с дополненной памятью на 3.0 балла.
APEx обеспечивает самосовершенствование без необходимости в истинных ответах (ground-truth) с регуляризацией выравнивания навыков для предотвращения дрейфа политики, достигая наилучших результатов на сложных вопросах.