Un estudio de ocho modelos revela que la memoria agente no es una característica universal, sino una dosis que debe calibrarse según la capacidad específica del modelo. El marco ALTK-Evolve destila directrices a partir de las trayectorias pasadas de un agente y las inyecta durante la inferencia sin actualizaciones de pesos, mostrando que las estrategias óptimas de memoria varían significativamente entre los niveles del modelo.

  • Los modelos fuertes con margen de mejora se benefician más de un conjunto completo de directrices, como se observa en DeepSeek-V3.2, que gana +9.5pp en finalización de tareas.
  • Los modelos más débiles obtienen el mejor rendimiento con una recuperación curada de un núcleo compacto más directrices por tarea, permitiendo que gpt-oss-120b gane +16.1pp con solo un coste adicional del 5% en tokens.
  • Los modelos saturados no mostraron ganancias medibles, lo que sugiere que han alcanzado su techo de rendimiento en las tareas evaluadas.
  • La recuperación curada ofrece mayor precisión y menor coste para los modelos débiles en comparación con la inyección del conjunto completo de directrices.

Los autores concluyen que la memoria debe calibrarse en lugar de simplemente acumularse, ya que proporcionar a un agente más experiencia de la que puede utilizar no produce beneficios. Recomiendan núcleos compactos para los modelos débiles y almacenamiento en caché de prompts para los modelos fuertes, con el fin de mantener los costes manejables en producción.