智譜AIは、GLM-5シリーズで初めてネイティブにマルチモーダルに対応したモデルであるGLM-5.3-Flashと、glm5_nextアーキテクチャの初のオープンウェイトリリースを発表しました。320Bパラメータのモデルは、30Tトークンのマルチモーダルコーパスで学習され、長いコンテキストの推論コストを削減するために、ハイブリッドなスパース注意機構と線形注意機構を組み合わせています。

  • アーキテクチャ: KDA線形注意機構とDeepSeekスタイルのスパース注意機構を組み合わせた45層で構成され、スケーリング効率のためにManifold-Constrained Hyper-Connections (mHC) を採用しています。
  • マルチモーダル機能: 24層のViTエンコーダにより、画像と動画のトークンを語彙に含め、最大1,048,576トークンのコンテキスト長をサポートします。
  • ウェイト: Hugging FaceおよびModelScopeでMITライセンスの下、FP8 (e4m3) および BF16形式で公開されています。
  • 推論サポート: vLLMとSGLang向けの公式レシピが提供されており、スペキュレーティブデコーディングの設定も含まれています。

このリリースは、コーディングやエージェントのベンチマークにおいてClaude Opus 4.8に迫るパフォーマンスを実現しつつ、推論コストを大幅に削減する費用対効果の高い代替案を提供することを目的としています。