llama.cpp 项目发布了构建版本 b10691,解决了 Metal 后端中的一个关键稳定性问题。该更新专门解决了在 F16 源乘法运算期间发生的 null-pipeline 崩溃。

  • 修复了 F16 src1 mul_mat 和 mul_mat_id 操作的 null-pipeline 崩溃。
  • 为缺少 F16 内核的 mul_mat 形状实现了 fail-closed 行为。
  • 在 encoder_set_pipeline 中添加了针对 nil pipelines 的中止逻辑。
  • 将 mul_mat mm 调度与 supports_op 共享,以提高代码一致性。

此版本提供了适用于 macOS、iOS、Linux、Windows、Android 和 openEuler 的二进制文件,涵盖 CPU、GPU 以及包括 CUDA、ROCm、Vulkan 和 OpenVINO 在内的专用硬件后端。