Компания Cartesia выпустила Sonic-3.6 — новейшую версию своей модели преобразования текста в речь в реальном времени, которая теперь занимает 1-е место в обоих рейтингах синтеза речи от Artificial Analysis. Обновление делает акцент на улучшении естественности звучания и использует пространственные модели (state space models) вместо трансформеров для достижения задержки до первого аудио менее 90 мс.
- Sonic-3.6 набирает 1 283 очка Elo в рейтинге Provider Voice и 1 283 очка Elo в рейтинге Controlled Voice.
- Модель доступна в бета-версии через хостинговый API Cartesia, но не предоставляет весов для самостоятельного размещения.
- Ключевые производственные функции включают теги выражений в потоке, мгновенное клонирование голоса на основе 10 секунд аудио и нативную поддержку алфавитно-цифровых символов.
- Artificial Analysis нормализует цену до $49.00 за 1 млн символов, что вдвое дешевле, чем ElevenLabs Eleven v3.
Выпуск представляет собой коммерчески пригодное потоковое решение для синтеза речи, которое балансирует между низкой задержкой и высокой естественностью звучания для таких приложений, как поддержка клиентов и локализация медиа.