Pesquisadores apresentam o Memory Decoder at Scale, um sistema que amplia modelos de memória paramétrica de longo prazo até 6,9B parâmetros e os pré-treina em 300B tokens. Para lidar com a inviabilidade dos pipelines padrão do Faiss nessa escala de dados, os autores implementam um pipeline de indexação distribuído com carregamento esparsa e por lotes das distribuições kNN.
- O sistema amplia modelos de memória para 6,9B parâmetros e utiliza 300B tokens para o pré-treinamento.
- Um pipeline distribuído lida com a indexação e recuperação do Faiss, utilizando carregamento esparsa e por lotes das distribuições kNN.
- Associar uma memória geral de 6,9B ao Pythia-410M eleva sua pontuação média de 29,86 para 37,34, superando o Pythia-12B (37,24) com 39% menos parâmetros totais.
- Para modelos Qwen3 Base que variam de 0,6B a 14B, memórias de domínio de 1,7B melhoram a pontuação média em três domínios em mais de 9 pontos em todas as escalas.
Os resultados demonstram que ampliar independentemente a memória pré-treinada oferece um caminho mais eficiente em termos de parâmetros para melhorar o desempenho de modelos de linguagem em comparação com a ampliação apenas do modelo base.