SplitMoE — это альтернативная архитектура Mixture of Experts, которая разбивает широкие слои прямого распространения на меньшие специализированные подкомпоненты для повышения гибкости представления токенов и вычислительной модульности.
- Она использует более мелкую гранулярность по сравнению со стандартными MoE, такими как Mixtral, позволяя токенам формировать сложные представления с помощью специализированных путей параметров.
- Подход разделяет скрытые измерения экспертов так, что токены активируют только те подсети, которые им нужны, что приводит к снижению количества операций с плавающей запятой (FLOPs) на активированный путь.
- В отличие от DeepSeekMoE, SplitMoE исследует механизмы разделения и группировки по промежуточным измерениям без строгого принуждения к стандартным фиксированным общим путям.
- Она фокусируется на оптимизированной стратегии разбиения, чтобы маршрутизация оставалась легкой и избегала больших накладных расходов на диспетчеризацию.
Автор предоставляет модульную реализацию на PyTorch для бенчмаркинга и приглашает к обратной связи по стабильности маршрутизации и поведению при масштабировании.