Cartesia a publié Sonic-3.6, la dernière version de son modèle de synthèse vocale en temps réel, qui occupe désormais la 1ère position sur les deux classements de synthèse vocale d'Artificial Analysis. La mise à jour se concentre sur une naturalité améliorée et s'appuie sur des modèles d'état d'espace plutôt que sur des transformateurs pour atteindre une latence inférieure à 90 ms avant la première audio.

  • Sonic-3.6 obtient un score Elo de 1 283 sur le tableau Provider Voice et un score Elo de 1 283 sur le tableau Controlled Voice.
  • Le modèle est disponible en bêta via l'API hébergée de Cartesia, mais ne propose pas de poids auto-hébergés.
  • Les principales fonctionnalités de production incluent des balises d'expression intégrées, un clonage vocal instantané à partir de 10 secondes d'audio et une prise en charge native des caractères alphanumériques.
  • Artificial Analysis normalise le prix à 49,00 $ par 1 M de caractères, soit la moitié du coût d'ElevenLabs Eleven v3.

Cette version propose une solution TTS en streaming déployable commercialement qui équilibre faible latence et haute naturalité pour des applications telles que le support client et la localisation multimédia.