Исследование восьми моделей показало, что агентная память не является универсальной функцией, а представляет собой дозу, которую необходимо калибровать в соответствии с конкретными возможностями модели. Фреймворк ALTK-Evolve извлекает рекомендации из прошлых траекторий агента и внедряет их во время вывода без обновления весов, демонстрируя, что оптимальные стратегии памяти существенно различаются для разных уровней моделей.
- Сильные модели с запасом возможностей получают наибольшую выгоду от полного набора рекомендаций, как продемонстрировал DeepSeek-V3.2, увеличив выполнение задач на +9.5pp.
- Более слабые модели лучше всего работают при выборочном извлечении компактного ядра плюс рекомендаций для каждой задачи, что позволило gpt-oss-120b увеличить результат на +16.1pp всего за дополнительные 5% токенов.
- Насыщенные модели не показали измеримого улучшения, что указывает на достижение ими потолка производительности в протестированных задачах.
- Выборочное извлечение обеспечивает более высокую точность и меньшие затраты для слабых моделей по сравнению с внедрением полного набора рекомендаций.
Авторы приходят к выводу, что память следует калибровать, а не просто накапливать, поскольку предоставление агенту большего опыта, чем он может использовать, не приносит пользы. Они рекомендуют использовать компактные ядра для слабых моделей и кэширование промптов для сильных моделей, чтобы поддерживать затраты на приемлемом уровне в производственной среде.