La empresa parisina de IA de voz Gradium ha lanzado Voice Design, una función que genera nuevas voces sintéticas a partir de descripciones escritas sin necesidad de audio de referencia. La herramienta ya está disponible en la API y Studio de Gradium en cinco idiomas.

  • Los usuarios introducen descripciones de 1 a 500 caracteres que detallan atributos como género, edad, acento y tono para recibir hasta 5 candidatos de voz en 3 a 5 segundos.
  • Los candidatos se generan mediante un flujo REST de cuatro llamadas, donde las voces seleccionadas pueden promocionarse a ranuras permanentes de voz personalizada utilizando una ranura compartida con clones.
  • En pruebas de escucha ciegas por pares a través de 7.627 comparaciones, Gradium logró una tasa de victoria del 72,6% frente a competidores como ElevenLabs e Inworld.
  • El sistema es no determinista, lo que significa que el mismo prompt produce resultados diferentes cada vez, y los candidatos no guardados expiran después de 30 días.

Esto permite a los desarrolladores crear personas de voz específicas bajo demanda sin necesidad de obtener derechos o consentimiento de hablantes reales.