llama.cpp 项目发布了版本 b10094,引入了一项功能,可从草稿仓库侧车自动检测推测解码类型。此前,当使用 `-hfd` 标志指向包含 mtp-、dflash- 或 eagle3- 侧车的仓库而未显式提供 `--spec-type` 时,系统会错误地将草稿解析为完整模型。

通过此次更新,如果未指定推测类型,llama-server 将发现草稿仓库中可用的侧车,并按照 mtp、dflash、eagle3 的优先级顺序选择第一个。这允许用户运行如 `llama-server -hf repo:Q3_K_M -hfd repo:Q8_0` 的命令而无需额外标志。显式提供 `--spec-type` 参数仍会禁用此自动推断功能。

该版本包含适用于 macOS(Apple Silicon 和 Intel)、iOS、Linux(Ubuntu x64/arm64/s390x,支持 CPU、Vulkan、ROCm 7.2、OpenVINO、SYCL)、Android arm64、Windows(CPU、OpenCL Adreno、CUDA 12/13、Vulkan、OpenVINO、SYCL、HIP)以及 openEuler 的二进制文件。