llama.cpp プロジェクトはビルド b11307 をリリースし、推論デコーディング中に元のバッチシーケンスを保持するためにレイヤー入力の順序を修正しました。この変更により、マスクされていない NextN 埋め込みのトークン順序が正しく維持され、テンソル分割と互換性を持つことが保証されます。
- ゼロオフセットからマイクロバッチテンソルをコピーすることで、同期後に元の行順序を復元します。
- レイヤー入力キャプチャが無効になっている場合でも、マスクされていない NextN 行に対して元のトークンマッピングを使用します。
- WebGPU の予約と OpenVINO の隠れ状態キャプチャの問題を修正しました。
- Qwen3.8-27B が MT-Bench を並列度 16 で完了する中で、256 の CPU/CUDA/テンソル構成で検証されました。
このアップデートは、レイヤー入力と埋め込みの順序の破損を防ぐことで、推論デコーディングワークフローの正確性を保証します。