llama.cpp 版本 0.4.0 引入了对 Qwen3.8-Flash-Next 和 NVIDIA Nemotron-3-Puzzle-75B-A9B 模型的初始架构支持,同时将底层 ggml 库升级至 0.23.0 版本。

  • 添加了按需惰性张量读取和每个插槽的服务器上下文限制。
  • 将 ggml 更新到 0.23.0,增加了稀疏 flash attention 和 Apple RDMA 传输支持。
  • 引入了视频输入选项、n-gram 历史查找以及量化器的 RAM 上限。
  • 在服务器中默认启用 `preserve_reasoning`,并改进了多模态分词辅助工具。

这些更改扩展了模型兼容性,并为开发人员提供了对内存使用和服务器资源分配的更精细控制。