llama.cpp 项目发布了版本 b10413,该版本引入了直接从草稿 GGUF 模型元数据中自动检测推测解码规范类型的功能。
- 通过读取草稿 GGUF 头文件中的 `general.architecture` 并将 `dflash` 和 `markov_w1.weight` 等张量映射到 `draft-dspark` 或 `draft-dflash`,自动检测规范类型。
- 修复了在不显式指定 `--spec-type` 的情况下加载本地草稿模型时,推测解码保持非活动状态(类型为 NONE)的问题。
- 使用 RAII 模式将规范类型检测逻辑移至推测模块,并添加日志以在自动检测发生时通知用户。
- 提供适用于 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、OpenVINO、SYCL)、Android、Windows(CPU、CUDA 12/13、Vulkan、OpenCL、ROCm)和 openEuler 的二进制文件。
此更改确保本地草稿模型的推测解码能够正确激活,而无需手动配置规范类型。