llama.cpp 项目发布了构建版本 b11227,其中包括专门针对多模态处理期间 `causal_attn` 标志处理的性能优化。

  • 调度器在切换 `causal_attn` 时不再重新保留内存,消除了之前减慢 Gemma 等模型视觉输入速度的昂贵传递过程。
  • qwen4exp 索引器的偏置形状现在独立于 `causal_attn`,防止在 `GGML_SCHED_NO_REALLOC` 约束下发生缓冲区重新分配失败。
  • 在 llama-server 上使用 gemma-4-26B-A4B 的基准测试显示延迟显著降低,例如在 RTX 4090 上处理 24 张图像时速度提升 7.61 倍,在 H200 上使用大上下文设置时最高提升 3.40 倍。

这些更改提高了多图像和视频输入的推理速度,而不改变生成的输出或图重建行为。