llama.cpp 项目发布了构建版本 b10762,引入了对 DeepSeek-V4-Flash-Vision-Exp 模型的支持。此更新还包括通过命令行界面处理最小和最大 token 数量。
本次发布的主要更改包括:
- 为 DeepSeek-V4-Flash-Vision-Exp 添加了 mtmd 支持。
- 通过 CLI 实现了 min/max token 数量的处理。
- 切换为使用 GGML_ROPE_TYPE_VISION。
- 修正了 token 数量逻辑并移除了调试代码。
该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的二进制文件,支持包括 CPU、CUDA、ROCm、Vulkan 和 OpenVINO 在内的各种硬件后端。