SplitMoE는 토큰 표현의 유연성과 계산 모듈성을 개선하기 위해 넓은 피드포워드 레이어를 더 작고 전문적인 하위 구성 요소로 분해하는 대체 Mixture of Experts 아키텍처입니다.

  • Mixtral과 같은 표준 MoE보다 더 세분화된 입자를 채택하여, 토큰이 전문적인 매개변수 경로를 사용하여 미묘한 표현을 구성할 수 있습니다.
  • 이 접근 방식은 전문가의 숨겨진 차원을 슬라이스하여 토큰이 필요한 특정 하위 네트워크만 활성화하도록 하여, 활성화된 경로당 FLOPs를 줄입니다.
  • DeepSeekMoE와 달리 SplitMoE는 표준 고정 공유 경로를 엄격하게 강제하지 않고 중간 차원 전반에 걸친 분할 및 그룹화 메커니즘을 탐구합니다.
  • 라우팅을 가볍게 유지하고 무거운 디스패치 오버헤드를 피하기 위해 간소화된 파티셔닝 전략에 중점을 둡니다.

저자는 벤치마킹을 위한 모듈형 PyTorch 구현을 제공하며, 라우팅 안정성 및 확장 동작에 대한 피드백을 초대합니다.