研究人员提出了“大规模记忆解码器”(Memory Decoder at Scale),该系统将参数化长期记忆模型扩展至6.9B参数,并在300B个token上进行预训练。为了解决在该数据规模下标准Faiss管道不可行的问题,作者实现了一个分布式索引管道,采用稀疏的、按批次加载kNN分布的方式。

  • 该系统将记忆模型扩展至6.9B参数,并使用300B个token进行预训练。
  • 分布式管道处理Faiss索引和检索,利用稀疏的、按批次加载的kNN分布。
  • 将6.9B通用记忆与Pythia-410M配对,使其平均分从29.86提升至37.34,以少39%的总参数量超越了Pythia-12B(37.24)。
  • 对于0.6B至14B范围的Qwen3 Base模型,1.7B领域记忆在每种规模下使三个领域的平均分提升超过9分。

结果表明,与仅扩展基础模型相比,独立扩展预训练记忆为提升语言模型性能提供了更参数高效的途径。