llama.cpp 项目发布了构建版本 b11039,该版本更新模型保存器以写入滑动窗口注意力(SWA)模式和所有使用 SWA 的模型的 MLA SWA 几何结构。此更改确保将 `sliding_window_pattern` 写为逐层标志,而不是折叠为标量,从而保留精确的数据表示。
- 加载器现在通过 `llama_model_base::load_swa_pattern()` 将 SWA 模式读取为周期或逐层数组,修复了 olmo2、gemma3n 和 exaone4 转换器中忽略数组的静默问题。
- 模型保存器写入 MLA 键/值长度和 SWA 层的 KV LoRA 秩,这是 dots3note 所必需的。
- 这使 plamo3、gemma3、cohere2、cohere2moe、olmo2、exone-moe、afmoe、mimo2、spark2_5、muse-glimmer、mellum、laguna、granite_swa、dots3note 和 maple 的保存器得以启用。
- 所有列出的模型均通过 test-llama-archs 的逐位精确往返测试。
此次更新确保 llama.cpp 生成的 GGUF 文件与预期的 SWA 配置匹配,同时不改变依赖默认周期的现有已发布文件的输出。