A empresa francesa de IA de voz Gradium lançou o Voice Design, um recurso que gera novas vozes sintéticas a partir de descrições escritas sem exigir áudio de referência. A ferramenta já está disponível na API e no Studio da Gradium em cinco idiomas.
- Os usuários inserem descrições de 1 a 500 caracteres detalhando atributos como gênero, idade, sotaque e tom para receber até 5 candidatos a voz em 3 a 5 segundos.
- Os candidatos são gerados por meio de um fluxo REST com quatro chamadas, onde as vozes selecionadas podem ser promovidas a slots permanentes de voz personalizada usando um slot compartilhado com clones.
- Em testes de audição cega por pares em 7.627 comparações, a Gradium alcançou uma taxa de vitória de 72,6% contra concorrentes como ElevenLabs e Inworld.
- O sistema é não determinístico, o que significa que o mesmo prompt produz resultados diferentes a cada vez, e os candidatos não salvos expiram após 30 dias.
Isso permite que desenvolvedores criem personas de voz específicas sob demanda sem precisar obter direitos ou consentimento de falantes reais.