8つのモデルに関する研究により、エージェントメモリは普遍的な機能ではなく、特定のモデルの能力に合わせて調整すべき用量であることが明らかになった。ALTK-Evolveフレームワークは、エージェントの過去の軌道からガイドラインを蒸留し、重み更新なしで推論時に注入する。これにより、最適なメモリ戦略がモデル階層間で大きく異なることが示された。
- 余力のある強力なモデルは、DeepSeek-V3.2がタスク完了率で+9.5pp向上したように、完全なガイドラインセットから最も恩恵を受ける。
- より弱いモデルは、コンパクトなコアと各タスク固有のガイドラインを厳選して取得する方が最良のパフォーマンスを発揮し、gpt-oss-120bはトークンコストが+5%増で+16.1ppの向上を実現した。
- 飽和状態にあるモデルでは測定可能な改善が見られず、テストされたタスクにおいて性能限界に達していることを示唆している。
- 厳選された取得は、完全なガイドラインセットを注入するよりも、弱いモデルにとってより高い精度と低コストをもたらす。
著者らは、メモリは単に蓄積するのではなく調整すべきであり、エージェントが処理できる以上の経験を与えても利益はないと結論づけている。彼らは、弱いモデルにはコンパクトなコアを、強力なモデルにはプロンプトキャッシングを推奨し、本番環境でのコストを抑えることを提案している。