llama.cpp 项目发布了构建版本 b10701,其中包括对 DFlash2 NVFP4 草稿模型的修复。此次更新解决了这些模型几乎不产生被接受的推测标记的问题。

  • 在 pull request #28000 中将缺失的 NVFP4 缩放值传递给注意力操作。
  • 确保 Q、K、V 和输出投影的缩放值正确传递给相应的图操作。

此更改通过纠正推测解码所需的缩放传播,恢复了 DFlash2 NVFP4 模型的正确功能。