llama.cpp 项目发布了构建版本 b10835,其中包含对 ggml-cuda 中 f16 flash attention 实现的分发屏障问题的修复。此更新还解决了同一模块中重复的元数据指针设置问题。

  • 修复了 ggml-cuda f16 flash attention 中的发散屏障(PR #27870)。
  • 防止在 ggml-cuda 中重复设置元数据指针。

此版本为 macOS、Linux、Windows、Android 和 openEuler 提供了更新的二进制文件,支持包括 CUDA、Vulkan、ROCm 和 SYCL 在内的各种 CPU 和 GPU 后端。