8개 모델에 대한 연구 결과, 에이전트 메모리는 보편적인 기능이 아니라 특정 모델의 능력에 맞게 보정해야 하는 용량임을 밝혀냈습니다. ALTK-Evolve 프레임워크는 에이전트의 과거 궤적에서 가이드라인을 추출하고 가중치 업데이트 없이 추론 시 주입하며, 최적의 메모리 전략이 모델 계층 간에 크게 달라짐을 보여줍니다.

  • 여력이 있는 강력한 모델은 DeepSeek-V3.2가 작업 완료율 +9.5pp 상승을 보인 것처럼 전체 가이드라인 세트에서 가장 큰 혜택을 받습니다.
  • 약한 모델은 컴팩트한 핵심과 작업별 가이드라인의 선별적 검색으로 최상의 성능을 발휘하며, gpt-oss-120b는 토큰 비용이 +5% 증가하는 데 그치면서 +16.1pp 상승을 달성했습니다.
  • 포화 상태의 모델은 측정 가능한 향상을 보이지 않았으며, 이는 테스트된 작업에서 성능 한계에 도달했음을 시사합니다.
  • 선별적 검색은 전체 가이드라인 세트를 주입하는 것보다 약한 모델에 더 높은 정확도와 낮은 비용을 제공합니다.

저자들은 에이전트가 사용할 수 있는 경험 이상을 제공해도 이점이 없으므로 메모지는 축적하기보다 보정해야 한다고 결론지었습니다. 그들은 생산 환경에서 비용을 관리 가능하게 유지하기 위해 약한 모델에는 컴팩트 코어를, 강력한 모델에는 프롬프트 캐싱을 권장합니다.