Le projet llama.cpp a publié la compilation b10760, qui comprend des correctifs spécifiques pour le modèle Qwen3-tts-0.6B afin d'éviter l'instabilité numérique lors de l'inférence.

  • Le chargeur mtmd traite désormais proj_in du prédicteur de code qwen3-tts comme optionnel, s'alignant sur l'implémentation de référence où ce tenseur est omis.
  • La couche ffn_down du prédicteur de code est maintenue en précision F32 car ses activations atteignent un pic autour de 1.5e5, dépassant la limite du F16 et causant des erreurs NaN.

Ces modifications garantissent que le graphe gère correctement les poids manquants et empêche le débordement dans les couches à haute activation pour ce point de contrôle spécifique.