llama.cpp 项目发布了 b11132 版本,引入了对 Gemma 4 DSpark 草稿主干的支持。此更新启用了全注意力和 SWA Gemma 4 草稿的 GGUF 转换及运行时功能,包括绑定的输出权重和布尔类型主干元数据。
- 为具有全注意力和 SWA 变体的 Gemma 4 草稿模型添加了 dspark 支持。
- 通过 dflash 机制实现了从元数据推断 Gemma 草稿特征。
- 发布了适用于 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL、Snapdragon)、Windows(CPU、OpenCL、CUDA、Vulkan、OpenVINO、SYCL、ROCm)、Android 和 iOS 的二进制文件。
此发布使用户能够在广泛的硬件平台上于 llama.cpp 生态系统中使用 Gemma 4 模型。