llama.cpp 项目发布了构建版本 b10760,其中包括针对 Qwen3-tts-0.6B 模型的具体修复,以防止推理期间的数值不稳定。

  • mtmd 加载器现在将 qwen3-tts 代码预测器的 proj_in 视为可选,与省略该张量的参考实现保持一致。
  • 由于代码预测器的 ffn_down 层的激活峰值约为 1.5e5,超过了 F16 的上限并导致 NaN 错误,因此将其保持在 F32 精度。

这些更改确保图正确缺失权重处理,并防止此特定检查点中高层激活的溢出。