मल्टीवर्स कंप्यूटिंग ने ऑफलाइन टॉप-K लॉग्स कैशिंग को एक फ्यूज्ड चंक्ड कुलबैक-लीब्लर (KL) अवचलन हानि के साथ जोड़कर बड़े भाषा मॉडल ज्ञान विलय के लिए मेमोरी-कुशल दृष्टिकोण पेश किया। इस विधि से शिक्षक और छात्र दोनों मॉडलों को एक साथ मेमोरी में रखने की आवश्यकता समाप्त हो जाती है, जिससे VRAM की आवश्यकताएं काफी कम हो जाती हैं।
- सिस्टम शिक्षक के टॉप-100 लॉग्स को एक बार कैश करता है, जिससे प्रशिक्षण के दौरान शिक्षक को मेमोरी से हटाया जा सकता है।
- एक फ्यूज्ड चंक्ड KL लॉस अनुक्रमों को चंक्स में प्रक्रिया करता है, जिससे पूर्ण शब्दावली-अनुक्रम मैट्रिक्स के निर्माण से बचा जाता है।
- 32K टोकन संदर्भ के लिए पीक VRAM 85.2 GiB से घटकर 5.45 GiB हो जाता है, जो 15.6x की कमी है।
- 32,768 टोकन पर GPT-OSS 20B को विलय करने से हार्डवेयर की आवश्यकता चार GPU नोड्स से घटकर एक रह जाती है और थ्रूपुट बढ़कर 345.7 TFLOP/s हो जाता है।
ये बदलाव लंबे-संदर्भ विलय को एकल GPU पर व्यावहारिक बनाते हैं, जिससे किफायती बड़े पैमाने पर प्रयोग और मॉडल संपीड़न संभव होता है।