Z.ai는 활성 파라미터 18B를 가진 320B 파라미터 다중 모달 MoE 모델인 GLM-5.3-Flash를 출시했으며, 알리바바의 Qwen 팀은 활성 파라미터 6B를 가진 125B 모델인 Qwen3.8-Flash-Next를 출시했습니다. 독립적인 개발 과정이었음에도 불구하고 두 팀은 거의 동일한 아키텍처 구성을 채택했습니다.

  • 두 모델 모두 효율성과 정밀도를 균형 있게 맞추기 위해 선형 어텐션 레이어와 전체 어텐션 레이어의 3:1 하이브리드를 사용합니다.
  • 학습된 인덱서를 통해 컨텍스트가 4배 압축되며, 이는 희소 어텐션 예산을 2048 토큰으로 제한합니다.
  • 단일 잔여 스트림은 흐름 제어 개선과 메모리 오버헤드 감소를 위해 네 개의 병렬 게이트드 브랜치로 대체되었습니다.
  • 훈련은 직교화 전에 독립적인 변환으로 분할된 융합 투영 행렬을 사용하는 Muon 옵티마이저를 활용합니다.
  • 두 팀은 위치 인코딩에 대해 의견이 다릅니다: GLM은 RoPE를 포기하고 NoPE를 채택한 반면, Qwen은 훈련 후 생성을 멈추지 못한 NoPE 변형 버전 이후에도 RoPE를 유지했습니다.

이 수렴은 효율적인 긴 컨텍스트 모델링을 위한 업계의 공통된 방향성을 시사하지만, MiniMax는 추론 결핍으로 인해 선형 어텐션을 거부함으로써 이견을 보이고 있습니다.