Los investigadores proponen APEx, un marco de utilización jerárquica de experiencias diseñado para mejorar los agentes de investigación profunda que responden preguntas complejas utilizando herramientas externas. El sistema organiza el historial de interacciones en memorias de trayectoria a nivel de instancia y habilidades procedurales a nivel de categoría, acoplándolas a través de una arquitectura Executor, Distiller y Planner.

  • Optimizado mediante un paradigma de entrenamiento GRPO alternante de tres etapas para la destilación de habilidades guiada por recompensa.
  • Utiliza habilidades destiladas como priores procedurales para la adaptación en línea del Planner a través del aprendizaje por refuerzo en tiempo de prueba guiado por habilidades.
  • Alcanza un rendimiento de estado del arte en 7 benchmarks, superando a GPT-5.4 por 14.7 puntos y a la línea base más fuerte aumentada con memoria por 3.0 puntos.

APEx permite la auto-mejora sin ground-truth con regularización de alineación de habilidades para prevenir la deriva de la política durante las pruebas.