llama.cppプロジェクトは、GLM-5.3-Flash (GLM5-Next) モデルアーキテクチャの初期サポートを追加しました。これには、ハイブリッドインデックスメモリへの移行と早期のMulti-Token Prediction (MTP) 機能が含まれます。
- 初期のMTPサポートが追加されましたが、焦点を絞ったレビューを可能にするため、初期のプルリクエストでは除外されました。
- k-poolレイアウトは、シーケンス編集や共有テardown後の古さ(stale)を防ぐためにubatch間で保持されるようになりました。
- 循環ロールバックチェックポイントがconv状態とdelta net状態に対して正しく書き込まれるようになりました。
- 非連続クエリに対するbuild_attn_mhaストリームストライドのバグが修正され、GLM5-Nextに対する正しいマルチストリームプリフィルが確保されました。
- 量子化保護フィルターがクリーンアップされ、重複エントリが削除されました。
これらの変更により、CUDA、ROCm、CPUを含むさまざまなハードウェアバックエンドで、GLM5-Nextモデルの安定した推論と正しい状態管理が保証されます。