SplitMoE est une architecture alternative de Mixture of Experts qui décompose les couches feed-forward larges en sous-composants plus petits et spécialisés pour améliorer la flexibilité de la représentation des tokens et la modularité computationnelle.
- Elle adopte une granularité plus fine que les MoEs standard comme Mixtral, permettant aux tokens de composer des représentations nuancées à l'aide de chemins de paramètres spécialisés.
- L'approche découpe les dimensions cachées des experts afin que les tokens n'activent que les sous-réseaux spécifiques dont ils ont besoin, ce qui se traduit par moins de FLOPs par chemin activé.
- Contrairement à DeepSeekMoE, SplitMoE explore des mécanismes de division et de regroupement à travers les dimensions intermédiaires sans imposer strictement des chemins partagés fixes standard.
- Elle se concentre sur une stratégie de partitionnement simplifiée pour maintenir le routage léger et éviter une surcharge de dispatching lourde.
L'auteur fournit une implémentation modulaire en PyTorch pour le benchmarking et invite aux commentaires sur la stabilité du routage et le comportement de mise à l'échelle.