llama.cpp b10361 版本解决了一个关键错误,由于加载期间参数顺序不正确,导致 LGAI-EXAONE 4.5 模型未启用滑动窗口注意力(SWA)。
- 模型加载器现在通过修正读取 `hparams.n_layer()` 和 `LLM_KV_NEXTN_PREDICT_LAYERS` 的顺序,正确处理 EXAONE 4.5 GGUF 文件,确保 SWA 被正确激活。
- 用于构建模型的仅元数据路径现在跳过标记为 `TENSOR_SKIP` 的张量,防止在使用 nextn/MTP 层的架构中因空缓冲区类型导致的断言失败。
- 添加了测试以覆盖 EXAONE 4 hparams 顺序,验证修复是否将 `swa_type` 正确设置为 STANDARD 而非 NONE。
此更新确保官方 LGAI-EXAONE GGUF 发布版本能够正确使用滑动窗口注意力,并允许通过仅元数据路径构建具有 nextn/MTP 层的模型。