llama.cpp 项目发布了版本 b10615,引入了针对每个设备调优的量化 (Q, NE) flash-attention 向量操作,用于 Metal 后端。
- 添加了 53 个 f16 flash-attn 向量实例化,总数从 80 增加到 133。
- 实现了带有共享内存容量回退的调优表和分发布线。
- 扩展了向量调优以支持量化 KV 缓存。
- 包含了针对 M1 Pro、M2 Ultra 和 M5 Max 设备的调优参数。
此更新通过将特定的调优结果应用于 Metal 后端,优化了 Apple Silicon 硬件上的性能。