गूगल ने अपने गेमिनी ऑडियो परिवार का हिस्सा होने के रूप में दो नए टेक्सट-टू-स्पिच मॉडल, गेमिनी 3.8 फ्लैश TTS और गेमिनी 3.8 फ्लैश-लाइट TTS जारी किए हैं। इन मॉडल्स ने प्राकृतिक भाषा प्रॉम्प्ट्स से जनरेटिव वॉइस डिज़ाइन और गेमिनी API तथा गूगल AI स्टूडियो के माध्यम से पंक्ति-दर-पंक्ति प्रदर्शन निर्देश पेश किए हैं।

  • गेमिनी 3.8 फ्लैश TTS गेमिंग और इमर्सिव मीडिया के लिए क्रिएटिव डायरेक्शन को लक्षित करता है, जो 71.4 की स्कोर के साथ ह्यूमे AI वॉइस डिज़ाइन बेंचमार्क पर #1 स्थान पर है।
  • गेमिनी 3.8 फ्लैश-लाइट TTS डबिंग जैसे उच्च-वॉल्यूम और लागत-कुशल उत्पादन के लिए अनुकूलित है और ह्यूमे AI ओवरऑल क्वालिटी इंडेक्स पर #2 स्थान पर है।
  • इस रिलीज ने वॉइस लाइब्रेरी को 2,000 से अधिक प्रोडक्शन-रेडी वॉइसेज तक विस्तारित किया और 100 से अधिक भाषाओं में जनरेटिव डिज़ाइन सक्षम बनाया।
  • दोनों मॉडल नेटिव टू-स्पीकर स्टेजिंग, वोकल बर्स्ट्स, बैकचैनलिंग और स्थिर गुणवत्ता के साथ लॉन्ग-फॉर्म जनरेशन का समर्थन करते हैं।
  • वॉइस रप्लिकेशन के लिए 30-सेकंड का नमूना और मौखिक सहमति की आवश्यकता होती है, और सभी आउटपुट SynthID द्वारा वाटरमार्क किए जाते हैं।

ये मॉडल डेवलपर्स को टोन, पेसिंग और कैरेक्टर डिज़ाइन पर सूक्ष्म नियंत्रण प्रदान करते हैं, साथ ही विभिन्न उत्पादन आवश्यकताओं के लिए स्केलेबल विकल्प भी प्रदान करते हैं।