Los investigadores presentan Memory Decoder at Scale, un sistema que escala los modelos de memoria paramétrica a largo plazo hasta 6.9B de parámetros y los preentrena con 300B de tokens. Para abordar la inviabilidad de las tuberías estándar de Faiss a esta escala de datos, los autores implementan una tubería de indexación distribuida con carga dispersa y por lotes de distribuciones kNN.
- El sistema escala los modelos de memoria hasta 6.9B de parámetros y utiliza 300B de tokens para el preentrenamiento.
- Una tubería distribuida maneja la indexación y recuperación de Faiss, utilizando carga dispersa y por lotes de distribuciones kNN.
- Combinar una memoria general de 6.9B con Pythia-410M eleva su puntuación media de 29.86 a 37.34, superando a Pythia-12B (37.24) con un 39% menos de parámetros totales.
- Para los modelos Qwen3 Base que van desde 0.6B hasta 14B, las memorias de dominio de 1.7B mejoran la puntuación media en tres dominios en más de 9 puntos a cada escala.
Los resultados demuestran que escalar independientemente la memoria preentrenada ofrece una vía más eficiente en parámetros para mejorar el rendimiento del modelo de lenguaje en comparación con escalar únicamente el modelo base.