A empresa francesa de IA de voz Gradium lançou o Voice Design, um recurso que gera novas vozes sintéticas a partir de descrições escritas sem exigir áudio de referência. A ferramenta já está disponível na API e no Studio da Gradium em cinco idiomas.

  • Os usuários inserem descrições de 1 a 500 caracteres detalhando atributos como gênero, idade, sotaque e tom para receber até 5 candidatos a voz em 3 a 5 segundos.
  • Os candidatos são gerados por meio de um fluxo REST com quatro chamadas, onde as vozes selecionadas podem ser promovidas a slots permanentes de voz personalizada usando um slot compartilhado com clones.
  • Em testes de audição cega por pares em 7.627 comparações, a Gradium alcançou uma taxa de vitória de 72,6% contra concorrentes como ElevenLabs e Inworld.
  • O sistema é não determinístico, o que significa que o mesmo prompt produz resultados diferentes a cada vez, e os candidatos não salvos expiram após 30 dias.

Isso permite que desenvolvedores criem personas de voz específicas sob demanda sem precisar obter direitos ou consentimento de falantes reais.