llama.cpp 项目发布了构建版本 b11009,解决了融合 QKV 注意力层的分割状态和粒度计算的关键问题。

  • 模型代码现在根据 n_head * n_embd_head_k 正确计算 attn_qkv 的分割状态,解决了使用 --fuse-qkv 标志的 gemma4 模型的兼容性问题,其中 n_embd 为 5376 但 Q 为 8192。
  • 为 qwen35 和 qwen35moe 架构添加了对融合全注意力层的支持。
  • 添加了 TODO 标签 [TAG_SPLIT_QGATE_QWEN] 以跟踪 Qwen 模型 QGate 分割的进一步工作。

此版本确保特定的模型配置,特别是涉及 gemma4 和 qwen35 中融合 QKV 操作的配置,在没有状态计算错误的情况下正确运行。