llama.cpp 项目发布了构建版本 b10757,其中包含针对 Vulkan 后端的特定优化。此更新在 NUM_COLS 大于 4 时,能高效处理 IQ3_S 矩阵向量乘法中大于 4 的较大批次大小。

  • 对于指定的 Vulkan IQ3_S mat-vec 配置,在 n=8 时实现 5 倍性能提升。
  • 在 all_types mat-vec 扫描中,为 k=16*256 处的每种量化类型添加了两个案例。
  • 提供 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows(CPU、CUDA 12/13、OpenCL、Vulkan、OpenVINO、SYCL、ROCm)和 openEuler 的二进制文件。

此发布版本使用户能够在各种硬件平台上运行 llama.cpp,并针对特定量化类型提供了更新的 Vulkan 优化。