llama.cpp v0.6.0 引入了新的 llama_batch_ext 扩展批处理 API,用于混合 token 和嵌入输入,同时支持 GLM-5.3-Flash 320B 混合模型和 Clef 决策模型。

  • 新的 llama_batch_ext API 支持 MTP 和 deepstack 模型的逐 token 状态嵌入。
  • Qwen4Exp 现在提供高质量支持,具备 MTP 推测解码功能,在 DGX Spark 上提供约 1.5x 的解码加速。
  • 新的 /v1/systemone 服务器 API 支持五种决策模型:laya、julia-1、lev、openjev 和 kev。
  • Metal 获得了用于 F16 KV 的 tensor-API flash attention 内核,以及 MMA 矩阵乘法内核,在 Apple GPU 上速度提升高达 3 倍。
  • Web UI 进行了全面升级,增加了 Hugging Face Hub 数据层和模型下载管道。

此版本扩展了 llama.cpp 在多模态处理、推测解码性能及决策模型集成方面的能力。