연구자들은 상호작용 이력을 인스턴스 수준 궤적 메모리와 카테고리 수준 절차 기술로 조직하여 심층 연구 에이전트를 개선하는 계층적 경험 활용 프레임워크인 APEx를 제안합니다.

  • 시스템은 Executor, Distiller 및 Planner 모듈로 구성된 폐쇄 루프 아키텍처를 통해 이러한 메모리를 결합합니다.
  • 이 모듈들은 보상 유도 기술 증류를 위한 3단계 교대 GRPO 학습 패러다임을 통해 최적화됩니다.
  • 테스트 시간에는 증류된 기술이 온라인 Planner 적응을 위한 절차적 사전 지식으로 작용하며, 기술 유도 테스트 시 강화 학습을 사용합니다.
  • 7개 벤치마크에 대한 실험 결과는 APEx가 GPT-5.4보다 14.7점, 가장 강력한 메모리 증강 기반라인보다 3.0점 더 우수함을 보여줍니다.

APEx는 정책 드리프트를 방지하기 위한 기술 정렬 정규화를 사용하여 ground-truth 없는 자기 개선을 가능하게 하며, 복잡한 질문에 대해 최첨단 성능을 달성합니다.