llama.cpp 项目已发布 0.5.0 版本,重点在于后端性能、更广泛的模型覆盖范围以及更稳健的服务器运行。此次更新引入了对 HRM-Text (DFM Mimir 1B) 和 MiMo-V2.6 等新架构的支持,并通过 CUDA 和 Metal 优化显著提升了计算效率。

  • 使用隐式 GEMM 加速 CUDA conv2d 操作。
  • 新增 Metal MoE 和 SSM_CONV 融合优化。
  • 允许服务器通过逗号分隔的 TCP 地址和 UNIX 套接字绑定到多个地址。
  • 通过添加 input_image 支持,实现函数调用中的图像输出。
  • 将 ggml 更新至 v0.25.0,在后端中扩展超连接和 flash-attention 支持。

此次发布改进了由路由器派生的子进程的稳定性,并修复了多个聊天解析器问题,确保用户在生产环境中部署 llama.cpp 时运行更加可靠。