연구자들은 매개변수형 장기 메모리 모델을 6.9B 파라미터까지 확장하고 300B 토큰으로 사전 훈련하는 시스템인 대규모 Memory Decoder를 제시합니다. 이 데이터 규모에서 표준 Faiss 파이프라인의 실행 불가능성을 해결하기 위해, 저자들은 kNN 분포의 희소 및 배치별 로딩을 사용하는 분산 인덱싱 파이프라인을 구현했습니다.

  • 시스템은 메모리 모델을 6.9B 파라미터까지 확장하고 사전 훈련에 300B 토큰을 사용합니다.
  • 분산 파이프라인은 Faiss 인덱싱 및 검색을 처리하며, kNN 분포의 희소 및 배치별 로딩을 활용합니다.
  • 6.9B 일반 메모리를 Pythia-410M과 결합하면 평균 점수가 29.86에서 37.34로 상승하여, 총 파라미터 수를 39% 줄인 상태에서 Pythia-12B(37.24)를 능가합니다.
  • 0.6B에서 14B까지의 Qwen3 Base 모델에 대해, 1.7B 도메인 메모리는 모든 규모에서 세 도메인에 걸쳐 평균 점수를 9점 이상 향상시킵니다.

이 결과는 사전 훈련된 메모리를 독립적으로 확장하는 것이 기본 모델만 확장하는 것보다 언어 모델 성능을 개선하기 위해 더 파라미터 효율적인 경로를 제공함을 보여줍니다.