SplitMoE es una arquitectura alternativa de Mezcla de Expertos que descompone las capas de alimentación hacia adelante anchas en subcomponentes más pequeños y especializados para mejorar la flexibilidad de representación de tokens y la modularidad computacional.
- Adopta una granularidad más fina que los MoEs estándar como Mixtral, permitiendo que los tokens compongan representaciones matizadas utilizando rutas de parámetros especializadas.
- El enfoque divide las dimensiones ocultas de los expertos para que los tokens activen solo las subredes específicas que necesitan, lo que resulta en menos FLOPs por ruta activada.
- A diferencia de DeepSeekMoE, SplitMoE explora mecanismos de división y agrupación a través de dimensiones intermedias sin forzar estrictamente rutas compartidas fijas estándar.
- Se centra en una estrategia de partición optimizada para mantener el enrutamiento ligero y evitar una sobrecarga pesada de despachos.
El autor proporciona una implementación modular en PyTorch para benchmarking e invita a comentarios sobre la estabilidad del enrutamiento y el comportamiento de escalado.