llama.cpp 项目发布了 b11035 版本,在其 Vulkan 后端引入了对 IQ3_S MMQ 矩阵乘法内核的支持。

  • 更新包括针对 Vulkan 的新 IQ3_S MMQ matmul 内核。
  • Block_a_to_shmem 现在执行 2 字节加载以优化内存访问。
  • 对齐检查已进行调整,因为 IQ3_S 使用 K tile 大小。
  • 二进制文件适用于 macOS、Linux、Windows、Android 和 openEuler,涵盖 CPU、CUDA、ROCm、OpenVINO、SYCL 和 OpenCL 平台。

此版本为各种操作系统和硬件加速器提供了更新的二进制文件,使用户能够利用新的 Vulkan 量化支持。