Los investigadores proponen APEx, un marco de utilización jerárquica de experiencias que organiza el historial de interacciones en memorias de trayectoria a nivel de instancia y habilidades procedimentales a nivel de categoría para mejorar los agentes de investigación profunda.
- El sistema acopla estas memorias a través de una arquitectura de bucle cerrado que comprende los módulos Executor, Distiller y Planner.
- Estos módulos se optimizan mediante un paradigma de entrenamiento GRPO alternante en tres etapas para la destilación de habilidades guiada por recompensa.
- En el momento de la prueba, las habilidades destiladas sirven como priores procedimentales para la adaptación del Planner en línea utilizando aprendizaje por refuerzo durante la prueba guiado por habilidades.
- Los experimentos en 7 benchmarks muestran que APEx supera a GPT-5.4 por 14.7 puntos y a la línea base más fuerte aumentada con memoria por 3.0 puntos.
APEx permite la auto-mejora sin necesidad de ground-truth mediante regularización de alineación de habilidades para prevenir la deriva de la política, logrando un rendimiento de vanguardia en preguntas complejas.