llama.cppプロジェクトは、GLM5-Nextのマルチトークン予測(MTP)ヘッドのサポートを追加し、その特定のアーキテクチャ要件に対応する新しいグラフ構造を実装しました。このアップデートには、Headlessフォワード中にデッドな計算をスキップし、隠れ層の行を正しく抽出できるようにするためのNextNブロックの最適化が含まれています。
- GLM5-Next MTPグラフは、トークンを射影層を通じて埋め込み、no_buildタグを使用してトランクビルダーを再利用します。
- Headless NextNフォワードは、出力行がない場合にクエリパスとアテンション本体をスキップし、4トークンのキャッチアップカーネル時間を6.9 msから2.9 msに削減しました。
- 修正により、マスク付き抽出が正しい隠れ層の行を公開し、他のシーケンスと末尾セルを共有する部分的な再帰ロールバックを拒否することが保証されました。
- MTPグラフは、プルーニングではなく標準的なヘルパーを使用して行を切り詰め、他のMTPグラフと整合性を持たせました。
- トランクまたはNextNテンソルのみを含む場合でも、GGUFファイルをドラフトモデルとして読み込めるようになりました。
これらの変更により、llama.cppは再帰状態管理の正確性を維持しつつ、支援生成のためにGLM5-Nextをドラフトモデルとして効率的に実行できるようになりました。