Cartesia ha lanzado Sonic-3.6, la última versión de su modelo de texto a voz en tiempo real, que ahora ocupa el puesto #1 en ambas tablas de clasificación de síntesis de voz de Artificial Analysis. La actualización se centra en una mayor naturalidad y utiliza modelos de espacio de estados en lugar de transformadores para lograr una latencia de primer audio inferior a 90 ms.

  • Sonic-3.6 obtiene 1,283 Elo en la tabla Provider Voice y 1,283 Elo en la tabla Controlled Voice.
  • El modelo está disponible en beta a través de la API alojada de Cartesia, pero no ofrece pesos autoalojados.
  • Las características clave para producción incluyen etiquetas de expresión en línea, clonación instantánea de voz a partir de 10 segundos de audio y soporte nativo para caracteres alfanuméricos.
  • Artificial Analysis normaliza el precio en $49.00 por cada 1M de caracteres, lo que representa la mitad del costo de ElevenLabs Eleven v3.

El lanzamiento proporciona una solución TTS en streaming comercialmente desplegable que equilibra baja latencia con alta naturalidad para aplicaciones como atención al cliente y localización de medios.