SplitMoE هو بديل لهيكل Mixtures of Experts يكسر الطبقات العريضة للتغذية الأمامية إلى مكونات فرعية أصغر ومتخصصة لتحسين مرونة تمثيل الرموز والوحدة الحسابية.

  • يعتمد دقة أدق من MoEs القياسية مثل Mixtral، مما يسمح للرموز بتكوين تمثيلات دقيقة باستخدام مسارات معلمات متخصصة.
  • يقوم النهج بشطب الأبعاد المخفية للخبراء بحيث تنشط الرموز فقط الشبكات الفرعية المحددة التي تحتاجها، مما يؤدي إلى انخفاض عمليات الفلو (FLOPs) لكل مسار مُنشط.
  • على عكس DeepSeekMoE، يستكشف SplitMoE آليات التقسيم والتجميع عبر الأبعاد الوسيطة دون فرض مسارات مشتركة ثابتة قياسية بشكل صارم.
  • يركز على استراتيجية تقسيم مبسطة للحفاظ على التوجيه خفيف الوزن وتجنب عبء الإرسال الثقيل.

يقدم المؤلف تنفيذًا معياريًا بـ PyTorch للمعايرة ويدعو إلى ملاحظات حول استقرار التوجيه وسلوك القياس.