llama.cpp プロジェクトはビルド b10701 をリリースし、DFlash2 NVFP4 ドラフトモデルの修正が含まれています。このアップデートは、これらのモデルがほとんど承認された推論トークンを生成しない問題を解決します。

  • プルリクエスト #28000 で、注意演算に欠落していた NVFP4 スケールを渡します。
  • Q、K、V、および出力射影のスケールが対応するグラフ演算に正しく渡されることを保証します。

この変更により、推論デコーディングに必要なスケール伝播が修正され、DFlash2 NVFP4 モデルの適切な機能が回復しました。