El proyecto llama.cpp lanzó la compilación b10760, que incluye correcciones específicas para el modelo Qwen3-tts-0.6B para prevenir inestabilidad numérica durante la inferencia.

  • El cargador mtmd ahora trata proj_in del predictor de código qwen3-tts como opcional, alineándose con la implementación de referencia donde este tensor se omite.
  • La capa ffn_down del predictor de código se mantiene en precisión F32 porque sus activaciones alcanzan un pico alrededor de 1.5e5, excediendo el límite de F16 y causando errores NaN.

Estos cambios aseguran que el gráfico maneje correctamente los pesos faltantes y prevenga desbordamiento en capas de alta activación para este punto de control específico.