llama.cpp 项目发布了构建版本 b10311,其中包含对 Qwen3-TTS 管道的修复。此次更新解决了模型在生成过程中两次读取输入语句的问题。

  • 修复了非流式预填充覆盖层中的错误,该错误导致在 Qwen3-TTS 生成期间再次馈送文本流。
  • 修正了尾部文本隐藏状态,使其折叠为单个 tts_pad 行,以匹配预填充布局。
  • 提供适用于 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows(CPU、CUDA 12/13、Vulkan、OpenCL、ROCm、SYCL)和 openEuler 的二进制文件。