L'entreprise parisienne d'IA vocale Gradium a lancé Voice Design, une fonctionnalité qui génère de nouvelles voix synthétiques à partir de descriptions écrites sans nécessiter d'audio de référence. L'outil est désormais disponible dans l'API et Studio de Gradium pour cinq langues.

  • Les utilisateurs saisissent des descriptions de 1 à 500 caractères détaillant des attributs tels que le genre, l'âge, l'accent et la hauteur de voix pour recevoir jusqu'à 5 candidats vocaux en 3 à 5 secondes.
  • Les candidats sont générés via un flux REST en quatre appels, où les voix sélectionnées peuvent être promues vers des emplacements permanents de voix personnalisées en utilisant un emplacement partagé avec les clones.
  • Lors de tests d'écoute aveugle par paires sur 7 627 comparaisons, Gradium a obtenu un taux de victoire de 72,6 % contre des concurrents comme ElevenLabs et Inworld.
  • Le système est non déterministe, ce qui signifie que le même prompt produit des résultats différents à chaque fois, et les candidats non enregistrés expirent après 30 jours.

Cela permet aux développeurs de créer des personnalités vocales spécifiques à la demande sans devoir obtenir les droits ou le consentement de locuteurs réels.