NVIDIA ha lanzado una actualización para su modelo de síntesis de voz multilingüe Magpie, ampliando el soporte a doce idiomas con la adición de árabe estándar moderno, coreano y portugués brasileño. La publicación también incluye mejoras de calidad en los idiomas existentes mediante datos de entrenamiento actualizados y cambios arquitectónicos.

  • El modelo de pesos abiertos de 364M parámetros ahora soporta inglés, español, francés, alemán, italiano, vietnamita, mandarín, hindi, japonés y los tres nuevos idiomas.
  • Se ha habilitado un soporte ampliado para el cambio de código en hindi y japonés mediante procesamiento de grafema-a-fonema IPA y diccionarios de pronunciación personalizados.
  • El apilamiento de fotogramas y un transformador local reducen el tiempo de inferencia mientras mantienen la calidad del habla.
  • El modelo logra un Tiempo hasta el Primer Audio (TTFA) de 32ms en GPUs B200, dejando margen en el presupuesto de latencia para el procesamiento de ASR y LLM.
  • Las métricas objetivas muestran tasas de error de caracteres reducidas y mayor similitud del hablante en comparación con la versión anterior.

La actualización permite a los desarrolladores desplegar síntesis de voz multilingüe dentro de su propia infraestructura, optimizando para baja latencia, residencia de datos y personalización específica del dominio.