llama.cpp 项目发布了构建版本 b11307,修复了层输入顺序,以在推测解码期间保留原始批次序列。此更改确保未掩码 NextN 嵌入的 token 顺序得到正确维护,并与张量分割兼容。

  • 通过从零偏移复制微批次张量,在同步后恢复原始行顺序。
  • 即使禁用了层输入捕获,也使用原始 token 映射来处理未掩码的 NextN 行。
  • 修复了 WebGPU 预留和 OpenVINO 隐藏状态捕获问题。
  • 在 256 个 CPU/CUDA/张量配置上进行了验证,Qwen3.8-27B 在并发数为 16 时完成了 MT-Bench。

该更新通过防止层输入和嵌入的顺序损坏,确保了推测解码工作流的正确性。