शोधकर्ताओं ने Memory Decoder at Scale प्रस्तुत किया, एक सिस्टम जो पैरामीट्रिक लंबी अवधि की मेमोरी मॉडलों को 6.9B पैरामीटर तक स्केल करता है और उन्हें 300B टोकन पर प्रीट्रेन करता है। इस डेटा स्केल पर मानक Faiss पाइपलाइन के असंभव होने का सामना करने के लिए, लेखकों ने kNN वितरणों की स्पार्स, बैच-वाइज लोडिंग के साथ एक वितरित इंडेक्सिंग पाइपलाइन लागू की है।
- सिस्टम मेमोरी मॉडलों को 6.9B पैरामीटर तक स्केल करता है और प्रीट्रेनिंग के लिए 300B टोकन का उपयोग करता है।
- एक वितरित पाइपलाइन Faiss इंडेक्सिंग और रेट्रीवल को संभालती है, kNN वितरणों की स्पार्स, बैच-वाइज लोडिंग का उपयोग करते हुए।
- 6.9B सामान्य मेमोरी को Pythia-410M के साथ जोड़ने से उसका औसत स्कोर 29.86 से बढ़कर 37.34 हो जाता है, जिसमें कुल पैरामीटर में 39% की कमी के साथ Pythia-12B (37.24) को पार किया गया।
- 0.6B से 14B तक के Qwen3 Base मॉडलों के लिए, 1.7B डोमेन मेमोरी ने प्रत्येक स्केल पर तीन डोमेनों में औसत स्कोर को 9 अंक से अधिक बढ़ा दिया।
परिणाम दर्शाते हैं कि स्वतंत्र रूप से स्केल किया गया प्रीट्रेन्ड मेमोरी, केवल बेस मॉडल को स्केल करने की तुलना में भाषा मॉडल प्रदर्शन में सुधार के लिए अधिक पैरामीटर-कुशल मार्ग प्रदान करता है।