Исследователи представляют Memory Decoder at Scale — систему, которая масштабирует параметрические модели долговременной памяти до 6,9 млрд параметров и предварительно обучает их на 300 млрд токенов. Чтобы решить проблему невозможности использования стандартных конвейеров Faiss при таком объёме данных, авторы реализуют распределённый конвейер индексации с разреженной пакетной загрузкой распределений kNN.
- Система масштабирует модели памяти до 6,9 млрд параметров и использует 300 млрд токенов для предварительного обучения.
- Распределённый конвейер обрабатывает индексацию и поиск в Faiss, используя разреженную пакетную загрузку распределений kNN.
- Сочетание общей памяти на 6,9 млрд параметров с Pythia-410M повышает средний балл с 29,86 до 37,34, превосходя Pythia-12B (37,24) при на 39% меньшем общем количестве параметров.
- Для базовых моделей Qwen3 Base в диапазоне от 0,6 млрд до 14 млрд параметров доменные памяти объёмом 1,7 млрд параметров повышают средний балл по трём доменам более чем на 9 пунктов на каждом масштабе.
Результаты показывают, что независимое масштабирование предварительно обученной памяти обеспечивает более параметрически эффективный путь улучшения производительности языковых моделей по сравнению с масштабированием только базовой модели.