أطلقت شركة جراديوم، المتخصصة في الذكاء الاصطناعي للصوت ومقرها باريس، ميزة Voice Design التي تولد أصواتًا اصطناعية جديدة من أوصاف مكتوبة دون الحاجة إلى ملفات صوتية مرجعية. أصبحت الأداة متاحة الآن عبر واجهة برمجة التطبيقات (API) واستوديو جراديوم بخمس لغات.

  • يقوم المستخدمون بإدخال أوصاف تتراوح بين 1 إلى 500 حرف، تفصل سمات مثل الجنس والعمر واللكنة والنبرة، للحصول على ما يصل إلى 5 مرشحين للأصوات في غضون 3 إلى 5 ثوانٍ.
  • يتم توليد المرشحين عبر تدفق REST مكون من أربع استدعاءات، حيث يمكن ترقية الأصوات المختارة إلى فتحات أصوات مخصصة دائمة باستخدام فتحة واحدة مشتركة مع النسخ المتماثلة.
  • في اختبارات الاستماع الزوجية العمياء عبر 7,627 مقارنة، حققت جراديوم معدل فوز بنسبة 72.6% ضد منافسين مثل ElevenLabs وInworld.
  • النظام غير حتمي، مما يعني أن نفس النص الوصفي ينتج نتائج مختلفة في كل مرة، وتنتهي صلاحية المرشحين غير المحفوظين بعد 30 يومًا.

يتيح ذلك للمطورين إنشاء شخصيات صوتية محددة حسب الطلب دون الحاجة إلى الحصول على حقوق أو موافقة من متحدثين حقيقيين.