llama.cpp プロジェクトはビルド b10760 をリリースし、Qwen3-tts-0.6B モデルの数値不安定性を防ぐための特定の修正が含まれています。

  • mtmd ローダーは now qwen3-tts コード予測子の proj_in をオプションとして扱い、このテンソルを省略する参照実装と一致します。
  • コード予測子の ffn_down レイヤーは、その活性化が約 1.5e5 でピークに達し、F16 の上限を超えて NaN エラーを引き起こすため、F32 精度で保持されます。

これらの変更により、グラフが欠落した重みを正しく処理し、この特定のチェックポイントのハイアクティベーションレイヤーでのオーバーフローを防ぐことが保証されます。