Sebuah studi terhadap delapan model mengungkapkan bahwa memori agentic bukanlah fitur universal, melainkan dosis yang harus dikalibrasi sesuai dengan kemampuan spesifik model. Kerangka kerja ALTK-Evolve memadatkan pedoman dari lintasan masa lalu agen dan menyuntikkannya saat inferensi tanpa pembaruan bobot, menunjukkan bahwa strategi memori optimal bervariasi secara signifikan di berbagai tingkatan model.
- Model kuat dengan ruang untuk peningkatan paling banyak diuntungkan oleh set pedoman lengkap, seperti yang terlihat pada DeepSeek-V3.2 yang mengalami peningkatan +9.5pp penyelesaian tugas.
- Model lemah berkinerja terbaik dengan pengambilan terkurasi dari inti kompak ditambah pedoman per-tugas, memungkinkan gpt-oss-120b meraih peningkatan +16.1pp hanya dengan biaya token +5%.
- Model jenuh tidak menunjukkan peningkatan yang terukur, menyiratkan bahwa mereka telah mencapai batas kinerja pada tugas-tugas yang diuji.
- Pengambilan terkurasi menawarkan akurasi lebih tinggi dan biaya lebih rendah untuk model lemah dibandingkan dengan penyuntikan set pedoman lengkap.
Para penulis menyimpulkan bahwa memori harus dikalibrasi daripada sekadar diakumulasi, karena memberikan agen lebih banyak pengalaman daripada yang dapat digunakannya tidak memberikan manfaat. Mereka merekomendasikan inti kompak untuk model lemah dan caching prompt untuk model kuat agar biaya tetap terkendali dalam produksi.