llama.cpp b11413 版本引入了新的基于 Vulkan 的稀疏闪存注意力实现,支持量化的键和值张量。此更新解决了之前压缩方法中的性能问题,该方法对于具有大上下文窗口的解码任务来说成本过高。

  • 新方法将行拆分为由子组或线程处理的连续段,使用合并加载上的投票计数来维护升序索引列表。
  • 预构建的二进制文件适用于 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、CUDA 12/13、ROCm、OpenVINO、SYCL、Snapdragon)、Windows(CPU、Vulkan、CUDA、OpenVINO、SYCL、ROCm)、Android 和 iOS。
  • 该版本还包括 llama.cpp UI 和安全验证的认证。