llama.cpp 项目发布了版本 b11203,其中包括对 CUDA Fast Walsh-Hadamard Transform (FWHT) 的更改,以接受 F16 输入。此前,CUDA FWHT 仅接受 F32 输入;此更新使源类型成为模板参数,以便内核直接读取 F16 源,而无需转换副本。
该实现确保 `supports_op` 和分发调用共享一个检查连续性和形状条件的谓词,从而关闭可能导致断言失败的差距。在 A10 GPU 上的 test-backend-ops 通过了所有 1297 个 MUL_MAT 测试,包括 6 个新的 F16 Hadamard 案例以及现有的 F32 案例。
此版本为 macOS、Linux、Windows、Android 和 openEuler 提供了适用于 CPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL 和 Snapdragon 后端的二进制文件。