llama.cpp 项目发布了构建版本 b11238,通过新增的 `ggml_pad_ext` 函数引入了统一的左侧填充实现。此更改整合了 Parakeet、LFM2-Audio、Granite Speech 和 Gemma 4 等音频编码器之前使用的方法,确保 Gemma 4 的嵌入向量位级一致,同时简化了后端支持。

  • `ggml_pad_ext` 节点现在通过单一操作处理左侧填充,因为所有后端均已支持该功能,从而取代了复杂的移位或零填充拼接逻辑。
  • 更新包括一项优化:跳过仅读取填充数据的 DFlash2 采样,因为位于或超过 block_size 的项为零。
  • 预构建二进制文件适用于 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、CUDA 12/13、ROCm、OpenVINO、SYCL、Snapdragon)、Android、Windows 和 openEuler。

此版本通过标准化填充操作提高了不同模型架构之间的一致性,并为广泛的硬件平台提供了更新的二进制文件。