llama.cpp 项目发布了版本 b10099,其中包括对 CUDA 后端的重大更新,以改善 NVFP4 W4A4 激活量化。

  • 融合每通道 amax 和量化内核以获得更好的性能。
  • 在 NVIDIA 硬件可用时添加了对 nvfp4x4 内在函数的支持。
  • 使用内在函数优化了比例搜索并恢复了每块 amax 计算。
  • 实现了 32 字节加载和指针算术优化以减少开销。
  • 特别针对 NVIDIA 保护了 builtin_align(32) 结构的使用,指出 HIP 兼容性问题。

此版本为 macOS、Linux、Windows、Android 和 openEuler 提供了更新后的二进制文件,涵盖 CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL 和其他后端。