Компания Cartesia выпустила Sonic-3.6 — новейшую версию своей модели преобразования текста в речь в реальном времени, которая теперь занимает 1-е место в обоих рейтингах синтеза речи от Artificial Analysis. Обновление делает акцент на улучшении естественности звучания и использует пространственные модели (state space models) вместо трансформеров для достижения задержки до первого аудио менее 90 мс.

  • Sonic-3.6 набирает 1 283 очка Elo в рейтинге Provider Voice и 1 283 очка Elo в рейтинге Controlled Voice.
  • Модель доступна в бета-версии через хостинговый API Cartesia, но не предоставляет весов для самостоятельного размещения.
  • Ключевые производственные функции включают теги выражений в потоке, мгновенное клонирование голоса на основе 10 секунд аудио и нативную поддержку алфавитно-цифровых символов.
  • Artificial Analysis нормализует цену до $49.00 за 1 млн символов, что вдвое дешевле, чем ElevenLabs Eleven v3.

Выпуск представляет собой коммерчески пригодное потоковое решение для синтеза речи, которое балансирует между низкой задержкой и высокой естественностью звучания для таких приложений, как поддержка клиентов и локализация медиа.