llama.cpp プロジェクトはバージョン b11440 をリリースし、推測的 MTP 初期化の修正を含んでいます。この更新により、NextN 抽出フラグが変更された際にスケジューラが再予約され、マスクなし抽出の問題が防止されます。
- 推測的 MTP 初期化は、作成後にターゲットおよびドラフトコンテキストで NextN 抽出を有効にします。
- トランクグラフは出力行に切り捨てるのではなく、最後のレイヤーまですべてのトークンを保持します。
- フラグが変更された際に予約を無効化することで、次の計算が新しいグラフ形状で再予約できるようになります。
- バイナリは macOS、Linux、Windows、Android、iOS 向けに CPU、GPU、NPU バックエンドで利用可能です。
この変更により、デコーディング中に正しいバッチ形状の割り当てが保証され、GGML_SCHED_DEBUG_REALLOC エラーが防止されます。