llama.cpp 项目发布了构建版本 b10076,通过在 CUDA 后端对 `get_rows` 操作进行向量化并使用 int4 复制,引入了性能优化。此更改将行不变的工作从逐元素循环中提升出来,并添加了一个向量化路径,为连续的同类型数据每个线程复制 16 字节。

该实现在编译时和运行时受到门控控制,需要 16 字节对齐和特定的步长条件以确保正确性。占用门控通过让单行小收集保持在标量路径上,防止了回归。在 Strix Halo (gfx1151) 上,此优化将 DeltaNet 循环状态收集的延迟从 18.6us 降低到 13.0us。

该版本包括适用于 macOS、Linux、Windows、Android 和 openEuler 的二进制文件,涵盖 CPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL 和 OpenCL 后端。