llama.cpp プロジェクトはビルド b10701 をリリースし、DFlash2 NVFP4 ドラフトモデルの修正が含まれています。このアップデートは、これらのモデルがほとんど承認された推論トークンを生成しない問題を解決します。
- プルリクエスト #28000 で、注意演算に欠落していた NVFP4 スケールを渡します。
- Q、K、V、および出力射影のスケールが対応するグラフ演算に正しく渡されることを保証します。
この変更により、推論デコーディングに必要なスケール伝播が修正され、DFlash2 NVFP4 モデルの適切な機能が回復しました。