SplitMoEは、トークン表現の柔軟性と計算モジュール性を向上させるために、幅広いフィードフォワード層をより小さく専門的なサブコンポーネントに分解する代替のMixture of Expertsアーキテクチャです。

  • Mixtralなどの標準的なMoEよりも細かな粒度を採用し、専門的なパラメータパスを使用してトークンが微妙な表現を構成できるようにします。
  • このアプローチは専門家の隠れ次元をスライスし、トークンが必要とする特定のサブネットワークのみをアクティブにすることで、アクティブ化されたパスあたりのFLOPsを削減します。
  • DeepSeekMoEとは異なり、SplitMoEは標準的な固定共有パスを厳格に強制することなく、中間次元全体にわたる分割およびグループ化メカニズムを探ります。
  • ルーティングを軽量に保ち、重いディスパッチオーバーヘッドを回避するために、簡素化されたパーティショニング戦略に焦点を当てています。

著者はベンチマーク用のモジュラーPyTorch実装を提供し、ルーティングの安定性とスケーリング動作に関するフィードバックを求めています。