Z.aiは18Bのパラメータを持つ320BパラメータのマルチモーダルMoEモデルGLM-5.3-Flashをリリースし、アリババのQwenチームは6Bのパラメータを持つ125BモデルQwen3.8-Flash-Nextをリリースした。独立した開発にもかかわらず、両チームはほぼ同一のアーキテクチャ構成を採用した。

  • 両モデルとも、効率性と精度のバランスを取るために線形アテンション層とフルアテンション層の3:1ハイブリッドを使用している。
  • 文脈は、スパースアテンションの予算を2048トークンに制限する学習済みインデクサによって4倍圧縮される。
  • 単一の残差ストリームは、フロー制御を改善しメモリオーバーヘッドを削減するために4つの並列ゲート付きブランチに置き換えられた。
  • トレーニングには、直交化の前に独立した変換に分割された融合射影行列を持つMuon最適化子が使用される。
  • 両チームは位置エンコーディングについて意見が分かれている:GLMはRoPEを捨てNoPEを採用したが、QwenはNoPEバリアントがトレーニング後に生成を停止しなかったためRoPEを維持した。

この収束は、効率的なロングコンテキストモデリングのための業界全体の共通方向性を示唆しているが、MiniMaxは推論の欠如を理由に線形アテンションを拒否する異論者として残っている。