SplitMoE هو بديل لهيكل Mixtures of Experts يكسر الطبقات العريضة للتغذية الأمامية إلى مكونات فرعية أصغر ومتخصصة لتحسين مرونة تمثيل الرموز والوحدة الحسابية.
- يعتمد دقة أدق من MoEs القياسية مثل Mixtral، مما يسمح للرموز بتكوين تمثيلات دقيقة باستخدام مسارات معلمات متخصصة.
- يقوم النهج بشطب الأبعاد المخفية للخبراء بحيث تنشط الرموز فقط الشبكات الفرعية المحددة التي تحتاجها، مما يؤدي إلى انخفاض عمليات الفلو (FLOPs) لكل مسار مُنشط.
- على عكس DeepSeekMoE، يستكشف SplitMoE آليات التقسيم والتجميع عبر الأبعاد الوسيطة دون فرض مسارات مشتركة ثابتة قياسية بشكل صارم.
- يركز على استراتيجية تقسيم مبسطة للحفاظ على التوجيه خفيف الوزن وتجنب عبء الإرسال الثقيل.
يقدم المؤلف تنفيذًا معياريًا بـ PyTorch للمعايرة ويدعو إلى ملاحظات حول استقرار التوجيه وسلوك القياس.