SplitMoE é uma arquitetura alternativa de Mixture of Experts que divide camadas feed-forward largas em subcomponentes menores e especializados para melhorar a flexibilidade da representação de tokens e a modularidade computacional.
- Adota granularidade mais fina do que MoEs padrão como Mixtral, permitindo que os tokens componham representações matizadas usando caminhos de parâmetros especializados.
- A abordagem fatia as dimensões ocultas dos especialistas para que os tokens ativem apenas as sub-redes específicas que precisam, resultando em menos FLOPs por caminho ativado.
- Diferente do DeepSeekMoE, o SplitMoE explora mecanismos de divisão e agrupamento através de dimensões intermediárias sem forçar estritamente caminhos compartilhados fixos padrão.
- Foca em uma estratégia de particionamento simplificada para manter o roteamento leve e evitar sobrecarga pesada de despacho.
O autor fornece uma implementação modular em PyTorch para benchmarking e convida feedback sobre estabilidade de roteamento e comportamento de escalonamento.