تقدم Multiverse Computing نهجاً فعالاً من حيث الذاكرة لتقريب المعرفة في نماذج اللغات الكبيرة، من خلال الجمع بين تخزين اللوغاتات (logits) الأعلى قيمة بشكل غير متصل وخسارة تباعد كولباك-لايبلر (KL) المقطعية المندمجة. يلغي هذا الأسلوب الحاجة إلى الاحتفاظ بنماذج المعلم والطالب في الذاكرة في آنٍ واحد، مما يقلل بشكل كبير من متطلبات ذاكرة الفيديو.

  • يقوم النظام بتخزين اللوغاتات الأعلى 100 للمعلم مرة واحدة، مما يسمح بإزالة المعلم من الذاكرة أثناء التدريب.
  • تعالج خسارة تباعد كولباك-لايبلر المقطعية المندمجة التسلسلات على شكل مقاطع، متجنباً إنشاء مصفوفات كاملة للسياق والمفردات.
  • ينخفض ذروة استهلاك ذاكرة الفيديو لسياق يتكون من 32 ألف رمز من 85.2 جيجابايت صافي إلى 5.45 جيجابايت، أي انخفاض بنسبة 15.6 مرة.
  • يؤدي تقريب نموذج GPT-OSS 20B عند 32,768 رمزاً إلى تقليل احتياجات الأجهزة من أربع عقد معالجات رسومية إلى عقدة واحدة، وزيادة الإنتاجية إلى 345.7 تيرافلوب/ثانية.

تجعل هذه التغييرات عملية التقريب للسياقات الطويلة ممكنة على بطاقة رسومية واحدة، مما يتيح تجارب واسعة النطاق بأسعار معقولة وضغطاً للنماذج.