Проект llama.cpp выпустил сборку b10760, которая включает специфические исправления для модели Qwen3-tts-0.6B для предотвращения численной нестабильности во время вывода.

  • Загрузчик mtmd теперь рассматривает proj_in кодового предиктора qwen3-tts как опциональный, что согласуется с эталонной реализацией, где этот тензор отсутствует.
  • Слой ffn_down кодового предиктора сохраняется в точности F32, потому что его активации достигают пика около 1.5e5, превышая предел F16 и вызывая ошибки NaN.

Эти изменения гарантируют, что граф корректно обрабатывает отсутствующие веса и предотвращает переполнение в слоях с высокой активацией для этого конкретного контрольного пункта.