أطلقت جوجل نموذجين جديدين لتحويل النص إلى كلام، هما Gemini 3.8 Flash TTS وGemini 3.8 Flash-Lite TTS، كجزء من عائلة Gemini Audio. تقدم هذه النماذج تصميمًا صوتيًا مولدًا من مطالبات باللغة الطبيعية وتوجيه الأداء سطرًا بسطر عبر Gemini API وGoogle AI Studio.
- يستهدف Gemini 3.8 Flash TTS التوجيه الإبداعي للألعاب والوسائط الغامرة، متصدرًا المرتبة الأولى في Hume AI Voice Design Benchmark بنتيجة 71.4.
- تم تحسين Gemini 3.8 Flash-Lite TTS للإنتاج عالي الحجم وفعال من حيث التكلفة مثل الدبلجة، وحصل على المرتبة الثانية في Hume AI Overall Quality Index.
- يوسع هذا الإصدار مكتبة الأصوات لتشمل أكثر من 2,000 صوت جاهز للإنتاج ويمكّن التصميم المولد لأكثر من 100 لغة.
- يدعم كلا النموذجين العرض الأصلي لمتحدثين، والانفجارات الصوتية، والتفاعل الخلفي، والتوليد طويل المدى بجودة متسقة.
- يتطلب استنساخ الصوت عينة مدتها 30 ثانية وموافقة لفظية، مع وضع علامة مائية على جميع المخرجات بواسطة SynthID.
توفر هذه النماذج للمطورين تحكمًا دقيقًا في النبرة والإيقاع وتصميم الشخصية، بينما تقدم خيارات قابلة للتوسع لتلبية احتياجات الإنتاج المختلفة.