SplitMoE adalah arsitektur Mixture of Experts alternatif yang memecah lapisan feed-forward lebar menjadi sub-komponen yang lebih kecil dan terspesialisasi untuk meningkatkan fleksibilitas representasi token dan modularitas komputasi.
- Mengadopsi granularitas yang lebih halus daripada MoE standar seperti Mixtral, memungkinkan token menyusun representasi bernuansa menggunakan jalur parameter terspesialisasi.
- Pendekatan ini memotong dimensi tersembunyi ahli sehingga token hanya mengaktifkan sub-jaringan spesifik yang mereka butuhkan, menghasilkan FLOPs yang lebih rendah per jalur yang diaktifkan.
- Berbeda dengan DeepSeekMoE, SplitMoE mengeksplorasi mekanisme pemisahan dan pengelompokan melintasi dimensi intermediate tanpa secara ketat memaksa jalur bersama tetap standar.
- Fokus pada strategi partisi yang disederhanakan untuk menjaga routing tetap ringan dan menghindari overhead dispatching yang berat.
Penulis menyediakan implementasi PyTorch modular untuk benchmarking dan mengundang umpan balik tentang stabilitas routing dan perilaku penskalaan.