llama.cpp 项目发布了构建版本 b10730,其中包括针对 Qwen4exp 模型架构的优化。主要更改涉及按切片累加索引头,而不是使用转置和 sum_rows 操作,从而减少内存复制开销。

  • 在配备 Qwen3.8-Flash-Next UD-Q4_K_XL 的 RTX PRO 6000 上,提示处理速度从每秒 2170 个 token 提升至 2366 个 token。
  • 该优化消除了对索引查询冗余连续张量的要求,因为 rope 会返回一个全新分配的连续张量。
  • 生成速度保持不变,但提示处理的增益随上下文长度和 ubatch 大小而扩展。
  • 与先前版本相比,贪婪输出的每个 token 均保持不变。

此更新通过减少提示处理阶段的计算浪费,提高了涉及 Qwen4exp 模型的长上下文推理任务的效率。