Google ने दो नए टेक्स्ट-टू-स्पीच मॉडल, gemini-3.8-flash-tts और gemini-3.8-flash-lite-tts जारी किए हैं, जिनमें 2,000 से अधिक आवाज़ों की लाइब्रेरी है।
API केवल 30 सेकंड के ऑडियो नमूने का उपयोग करके कस्टम आवाज़ें बनाने का समर्थन करता है और उपयोगकर्ताओं को अलग-अलग आवाज़ शैलियों के साथ बहु-वक्ता संवादों को परिभाषित करने की अनुमति देता है।
परीक्षण में, 1 मिनट और 18 सेकंड का ऑडियो जनरेट करने में लगभग 20 सेकंड लगे और मानक Flash मॉडल का उपयोग करने पर इसकी लागत 2.74 सेंट आई।