Парижская компания Gradium, занимающаяся разработкой решений в области голосового ИИ, представила функцию Voice Design, которая позволяет создавать новые синтетические голоса на основе текстовых описаний без необходимости использования референсных аудиозаписей. Инструмент уже доступен в API и Studio Gradium для пяти языков.
- Пользователи вводят описание длиной от 1 до 500 символов, содержащее такие атрибуты, как пол, возраст, акцент и высота тона, чтобы получить до 5 вариантов голоса за 3–5 секунд.
- Варианты генерируются через четырехэтапный REST-запрос; выбранные голоса можно перенести в постоянные слоты пользовательских голосов, используя один общий слот вместе с клонами.
- В слепых попарных тестах прослушивания на основе 7627 сравнений Gradium показала уровень побед 72,6% против конкурентов, таких как ElevenLabs и Inworld.
- Система является недетерминированной: один и тот же запрос дает разные результаты при каждом использовании, а несохраненные варианты удаляются через 30 дней.
Это позволяет разработчикам создавать специфические голосовые персонажи по запросу без необходимости получения прав или согласия реальных дикторов.