Les chercheurs présentent Memory Decoder at Scale, un système qui met à l'échelle les modèles de mémoire à long terme paramétrique jusqu'à 6,9 milliards de paramètres et les pré-entraîne sur 300 milliards de tokens. Pour pallier l'irréalisme des pipelines Faiss standards à cette échelle de données, les auteurs implémentent un pipeline d'indexation distribué avec un chargement par lots et dispersé des distributions kNN.
- Le système met à l'échelle les modèles de mémoire jusqu'à 6,9 milliards de paramètres et utilise 300 milliards de tokens pour le pré-entraînement.
- Un pipeline distribué gère l'indexation et la récupération Faiss, en utilisant un chargement par lots et dispersé des distributions kNN.
- L'association d'une mémoire générale de 6,9 milliards de paramètres avec Pythia-410M élève sa note moyenne de 29,86 à 37,34, dépassant Pythia-12B (37,24) avec 39 % de paramètres totaux en moins.
- Pour les modèles Qwen3 Base allant de 0,6 milliard à 14 milliards, des mémoires de domaine de 1,7 milliard améliorent la note moyenne sur trois domaines de plus de 9 points à chaque échelle.
Les résultats démontrent que la mise à l'échelle indépendante de la mémoire pré-entraînée offre une voie plus économe en paramètres pour améliorer les performances des modèles de langage par rapport à la mise à l'échelle du modèle de base seul.