GLMチームはz.aiのブログに、推論インフラのアーキテクチャと設計に関する詳細な記事を掲載しました。
- この記事では、GLMがモデルサービングと最適化をどのように処理するかについて、技術的な深い概要を提供しています。
- 大規模言語モデルのデプロイメントシステムに興味のある人にとって、「非常に面白い読み物」とされています。
GLMチームはz.aiのブログに、推論インフラのアーキテクチャと設計に関する詳細な記事を掲載しました。
Z.aiは18Bのパラメータを持つ320BパラメータのマルチモーダルMoEモデルGLM-5.3-Flashをリリースし、アリババのQwenチームは6Bのパラメータを持つ125BモデルQwen3.8-Flash-Nextをリリースした。独立した開発にもかかわらず、両チームはほぼ同一のアーキテクチャ構成を採用した。
8つのモデルに関する研究により、エージェントメモリは普遍的な機能ではなく、特定のモデルの能力に合わせて調整すべき用量であることが明らかになった。ALTK-Evolveフレームワークは、エージェントの過去の軌道からガイドラインを蒸留し、重み更新なしで推論時に注入する。これにより、最適なメモリ戦略がモデル階層間で大きく異なることが示された。
llama.cpp プロジェクトは、GLM_DSA (GLM-5.2) モデルアーキテクチャ向けの NextN/MTP 推測デコーディングサポートを導入するビルド b10174 をリリースしました。
PIVOT(Proxy Indexing Via One full-prefix Traversal)は、DeepSeek Sparse Attention(DSA)インデクサのためのトレーニング不要なドロップイン置換であり、近くのクエリグループ間で1つのプレフィックススキャンを共有することで計算の冗長性を削減します。各クエリに対して個別にすべての先行トークンをスコアリングする代わりに、PIVOTはグループを単一のプロキシクエリに集約して候補セットを取得し、そこから各クエリのためにトップkトークンが選択されます。
あるユーザーがGLM-5.2 (753B MoE) モデルをNVFP4 4bit KVキャッシュを用いたInt4-Int8Mixに量子化し、4台のDGX Spark (GB10) システムで実行してTerminal-Bench 2.1で70.8%のスコアを達成した。
アクセス解析とサイト改善のために Cookie を使用します。分析 Cookie を許可または拒否できます。 プライバシーポリシー