llama.cpp 项目发布了版本 b10514,引入了 IBM's GraniteSWAForCausalLM 和 GraniteMoeSWAForCausalLM 架构的转换基础设施。此更新使用户能够将这两种特定模型类型转换为 GGUF 格式,以便与 llama.cpp 一起使用。

  • 为 GraniteSWAForCausalLM 和 GraniteMoeSWAForCausalLM 添加了 feat(convert) 支持。
  • 实现了 rope_pattern 数组和逐层 rope 确定的转换基础设施。
  • 修复了 SWA 模式逻辑以支持 non-rope 层,并更正了 ffn gate inp 的命名。
  • 使用 has_rope 常量更新了 llama_hparams,并移除了 hacky rope_finetuned fallbacks。
  • 包含了适用于 macOS、Linux、Windows 和 Android 的二进制文件,涵盖 CPU、CUDA、Vulkan、OpenCL 和其他后端。

此发布使 llama.cpp 生态系统能够原生支持 IBM's sliding window attention 模型,扩大了可用于本地推理的兼容架构范围。