llama.cpp b10814 版本通过添加九个新的逐元素一元运算并改进数据移动内核,扩展了对 OpenCL 后端的支持。
- 添加了扩展的逐元素一元运算,包括 sgn、step、elu、hardswish、hardsigmoid、floor、ceil、round 和 trunc,以防止 CPU 回退。
- 实现了一个连续的 f32 复制内核,针对整个设备分发线性移动,优化了具有少量长行的张量的性能。
- 通过将内核键入元素大小而非特定类型,将 CONCAT 支持扩展到所有易于复制的类型(f16、bf16、i8、i16、i32、i64)。
这些更改提高了 macOS、Linux、Windows 和 Android 上非 CPU 后端的 OpenCL 覆盖范围和效率。