llama.cpp 项目发布了版本 b11019,解决了一个关键错误:在非对齐偏移量处嵌入的 GGUF 文件会返回错误的张量数据。此次更新将 GGUF 数据部分相对于文件起始位置进行对齐,而不是相对于偏移量 0,从而确保正确加载嵌入模型。

  • 修复了 gguf_init_from_file_ptr,使其从 GGUF 起始位置填充数据部分,防止未对齐的嵌入文件出现错误。
  • 添加了 llama_adapter_lora_init_from_file_ptr,以支持通过 FILE* 流加载 LoRA 适配器。
  • 当嵌入的数据部分未对齐时,禁用 mmap 并发出警告,替换了 ggml 中的先前断言。
  • 提供了适用于 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL)、Android、Windows 和 openEuler 的二进制文件。

此版本确保了嵌入在其他容器中或位于任意文件偏移量处的 GGUF 文件的可靠运行。