गूगल ने दो नए टेक्स्ट-टू-स्पीच मॉडल, जेमिनी 3.8 फ्लैश TTS और जेमिनी 3.8 फ्लैश-लाइट TTS जारी किए हैं, जो निर्माताओं, डेवलपर्स और उद्यमों के लिए गतिशील आवाज़ जनरेशन क्षमताएं प्रदान करने के लिए जेमिनी ऑडियो परिवार का विस्तार करते हैं।
- जेमिनी 3.8 फ्लैश TTS गहन रचनात्मक निर्देशन सक्षम बनाता है, जिससे उपयोगकर्ता प्राकृतिक भाषा प्रॉम्प्ट्स का उपयोग करके शून्य से नई आवाज़ें बना सकते हैं और पंक्ति-दर-पंक्ति प्रदर्शन संकेतों पर नियंत्रण रख सकते हैं।
- जेमिनी 3.8 फ्लैश-लाइट TTS उच्च-आयतन, लागू-कुशल स्केल के लिए अनुकूलित है, जो टोन और गति पर सूक्ष्म नियंत्रण के साथ डबिंग और अभिव्यक्तिपूर्ण आवाज़ एजेंट्स का समर्थन करता है।
- मॉडल 100 से अधिक भाषाओं और बोलियों का समर्थन करते हैं, जिसमें मेक्सिकन स्पैनिश और स्कॉट्स इंग्लिश जैसे क्षेत्रीय रूप शामिल हैं, और 2,000+ उत्पादन-तैयार आवाज़ों की लाइब्रेरी प्रदान करते हैं।
- आवाज़ प्रतिकृति सुविधाओं से उपयोगकर्ता 30-सेकंड के नमूने से वोकल प्रोफाइल को पुनः बना सकते हैं, जो सहमति सत्यापन, SynthID वाटरमार्किंग और C2PA क्रेडेंशियल्स द्वारा समर्थित है।
- दोनों मॉडलों ने Hume AI के बेंचमार्क्स पर शीर्ष स्थान प्राप्त किए हैं, जहाँ जेमिनी 3.8 फ्लैश TTS ओवरऑल क्वालिटी इंडेक्स और वॉइस डिज़ाइन बेंचमार्क में अग्रणी है।
ये टूल्स डेवलपर्स के लिए Google AI Studio और जेमिनी API में उपलब्ध हैं, जबकि उद्यम पहुँच जल्द ही जेमिनी एंटरप्राइज़ के माध्यम से आएगी।