أطلقت Google نموذج Gemini 3.8 Flash TTS و Flash-Lite TTS عبر واجهة Gemini API ومنصة AI Studio، محققةً المراكز الأولى في معيار Hume لتصميم الصوت وساحة Voice Arena عبر ست لغات.

  • يمكن للمستخدمين الآن استنساخ صوت عن طريق تسجيل مقطعين بناءً على الموافقة أو تصميم صوت جديد من جملة واحدة دون تسجيلات سابقة.
  • تدعم الواجهة مؤثرات صوتية مضمنة مثل <short pause> وأنماط تسليم مفصلة عبر speech_metadata.style.
  • الأصوات المستنسخة قابلة لإعادة الاستخدام، بينما يمكن تخزين الأصوات غير المصرح بها كمفاتيح مشفرة تنتهي صلاحيتها بعد سبعة أيام.
  • تغيرت طريقة البرمجة النصية بشكل كبير: تُقرأ التعليمات داخل النص بصوت عالٍ، وتتطلب أدوار المتحدثين المتعددين وسوم متحدث صريحة، وقد تسبب النصوص الطويلة من نوع Audio Profile انحرافًا في الصوت.

يتيح التحديث تحكمًا دقيقًا في توليد الصوت الاصطناعي، على الرغم من أن النصوص البرمجية الموجودة من إصدار gemini-3.1-flash-tts-preview ستتعطل بدون ترحيل.