أطلقت AI2 النسخة الثالثة من Olmo-core، وهي بنية تحتية مفتوحة المصدر لإعادة تصميم التدريب لنماذج mixture-of-experts (MoE)، والتي تتسع لنطاق التريليون معلمة مع الحفاظ على الكفاءة الحسابية. ينتقل الإطار البرمجي من التساوي المتوازي للبيانات المجزأة بالكامل إلى التساوي المتوازي للبيانات الموزعة، مع بقاء الخبراء مقيمين على وحدات معالجة الرسومات لتحسين الإنتاجية وتقليل تكاليف الاتصال.

  • أظهرت معايير الأداء على ثماني وحدات NVIDIA B300 GPUs تحقيق نموذج MoE ذي 47 مليار معلمة لسرعة 52,000 توكن في الثانية لكل بطاقة GPU، مما يمثل زيادة بنسبة 2.7 مرة مقارنة بالتنفيذ السابق.
  • أدى تمكين دقة MXFP8 على أربع وحدات NVIDIA B300 GPUs إلى زيادة إنتاجية التدريب بنحو 21% وتقليل الذاكرة النشطة القصوى من 103 GiB إلى 95 GiB مقارنة بـ BF16.
  • يدعم النظام توازي الخبراء، والتوازي عبر الأنابيب، وتوازي المُحسّن لتوزيع أوزان النموذج وحالات التدريب عبر مجموعات وحدات معالجة الرسومات.
  • أظهرت معايير الأداء قابلية التوسع لنموذج يحتوي على 1.2 تريليون معلمة بسرعة 858 TFLOP/s/GPU، ووصلت التكوينات التجريبية إلى 2.38 تريليون معلمة.

تُعد مجموعة البرمجيات مفتوحة المصدر الأساس للأجيال القادمة من نماذج Olmo وتتيح للباحثين تدريب نماذج MoE الكبيرة الخاصة بهم بمرونة أكبر.