أطلقت جوجل نموذجين جديدين لتحويل النص إلى كلام، هما gemini-3.8-flash-tts وgemini-3.8-flash-lite-tts، مع مكتبة تضم أكثر من 2000 صوت.

تدعم واجهة برمجة التطبيقات (API) إنشاء أصوات مخصصة باستخدام عينة صوتية مدتها 30 ثانية فقط، وتتيح للمستخدمين تعريف محادثات متعددة المتحدثين بأنماط صوتية مميزة.

في الاختبارات، استغرق توليد دقيقة و18 ثانية من الصوت حوالي 20 ثانية وتكلف 2.74 سنت باستخدام النموذج القياسي Flash.