智譜は、GLM-5シリーズ初のネイティブマルチモーダルモデルであるGLM-5.3-Flashを発表しました。このモデルは、スパースアテンションと線形アテンションを組み合わせたハイブリッドアーキテクチャを採用し、精度を維持しつつ長文脈の推論コストを削減します。
このモデルは合計320Bのパラメータを使用しますが、アクティブなパラメータはわずか18Bです。ベンチマークではGLM-5.2を上回るパフォーマンスを発揮し、コーディングタスクではClaude Opus 4.8に迫る性能を示しながら、その価格は約1/10です。主な技術的革新には、スケーリング効率の向上のためのManifold-Constrained Hyper-Connections (mHC)と、能力と効率を中心に最適化された新しくトレーニングされたベースモデルが含まれます。
GLM-5.3-FlashはZ.ai APIプラットフォーム経由で利用可能であり、SGLang、vLLM、TokenSpeed、KTransformers、HLEなどのフレームワークを通じたデプロイメントをサポートしています。