llama.cpp 0.3.0 引入了对带有新 DSA-ISWA KV 缓存类型的 dots3-note 多模态模型的支持,并为 GLM-4.5-Air 添加了多令牌预测(MTP)支持。该版本还增加了对 DeepSeek 4 的 tensor-split 功能,并修复了多序列回滚问题。
- ggml 升级至 v0.22.0,在 meta-backend 和 per-op Metal 内核中增加了 tensor-split 支持,并采用并行编译。
- mtmd 获得了 dots3-note 视觉/音频支持、通过 ffmpeg 进行的 WebP 解码以及符合 Pillow 精度的调整大小算法。
- DeepSeek 4 通过 `-sm tensor` 标志获得 tensor-split 模式,并修复了多序列回滚问题。
- 服务器添加了 `LLAMA_SERVER_SLOTS_N_DIFF` 调试选项,而 Web UI 则增加了标签式聊天导航。
此次更新扩展了 llama.cpp 的多模态能力,并提升了针对 DeepSeek 4 和 GLM-4.5-Air 等特定模型架构的性能与稳定性。