Google ने Gemini API और AI Studio के माध्यम से Gemini 3.8 Flash TTS और Flash-Lite TTS जारी किया है, जिसने छह भाषाओं में Hume के Voice Design Benchmark और Voice Arena में शीर्ष रैंकिंग हासिल की है।
- उपयोगकर्ता अब दो सहमति-आधारित क्लिप रिकॉर्ड करके आवाज़ की प्रतिकृति बना सकते हैं या बिना पूर्व रिकॉर्डिंग के एक वाक्य से नई आवाज़ डिज़ाइन कर सकते हैं।
- API में <short pause> जैसे inline साउंड इफेक्ट्स और speech_metadata.style के माध्यम से विस्तृत डिलीवरी शैलियाँ समर्थित हैं।
- प्रतिकृति की गई आवाज़ें पुनः उपयोग योग्य हैं, जबकि बिना सहमति वाली आवाज़ों को सात दिनों बाद समाप्त होने वाले एन्क्रिप्टेड कुंजियों के रूप में संग्रहीत किया जा सकता है।
- प्रॉम्प्टिंग में महत्वपूर्ण बदलाव हुआ है: टेक्स्ट के अंदर निर्देशों को ज़ोर से पढ़ा जाता है, बहु-बोलने वाले बारीकियों के लिए स्पष्ट स्पीकर टैग की आवश्यकता होती है, और लंबे Audio Profile प्रॉम्प्ट आवाज़ ड्रिफ्ट का कारण बन सकते हैं।
अपडेट संश्लेषित आवाज़ उत्पादन पर सटीक नियंत्रण की अनुमति देता है, हालाँकि gemini-3.1-flash-tts-preview संस्करण से मौजूदा प्रॉम्प्ट बिना माइग्रेशन के टूट जाएंगे।