O projeto llama.cpp lançou a compilação b10760, que inclui correções específicas para o modelo Qwen3-tts-0.6B para prevenir instabilidade numérica durante a inferência.
- O carregador mtmd agora trata proj_in do preditor de código qwen3-tts como opcional, alinhando-se com a implementação de referência onde este tensor é omitido.
- A camada ffn_down do preditor de código é mantida em precisão F32 porque suas ativações atingem um pico em torno de 1.5e5, excedendo o limite do F16 e causando erros NaN.
Essas alterações garantem que o gráfico lide corretamente com pesos ausentes e previna estouro em camadas de alta ativação para este checkpoint específico.