llama.cpp b11372 版本引入了针对 qwen4exp 模型闪电索引器的优化,主要是在长上下文处理期间将索引器分数所需的内存减半。这是通过就地计算头分数而不是为每个头生成单独的张量来实现的。

  • qwen4exp 索引器现在复用分配器缓冲区并通过 ggml_lightning_indexer 计算分数,以降低峰值内存使用量。
  • 为具有 4 个头的闪电索引器添加了 CUDA 后端支持,将其分发到向量内核。
  • Metal 后端更新为从函数常量读取头数,允许在不更改代码的情况下运行任意数量的头。
  • Vulkan 后端使用共享内存和 fp16 点积将闪电索引器在键和令牌上进行分块。

这些更改提高了具有长上下文的 qwen4exp 模型的内存效率,同时保持了计算缓冲区大小和速度。