llama.cpp 项目发布了版本 b10241,解决了 CUDA 后端中的一个关键错误。此次更新解决了在块归约期间重用共享内存 (SMEM) 时发生的数据竞争问题。

  • 修复了 block_reduce 中从 SMEM 读取后缺少重新同步的问题,以防止数据竞争。
  • 为单行 softmax 和归一化操作实现了双缓冲机制。
  • 添加了专门针对多 warp 场景的解释性注释和内存屏障。
  • 提供了适用于 macOS、Linux、Windows、Android 和 iOS 的二进制文件,支持 CPU、CUDA、Vulkan、ROCm 及其他后端。