Google ने Gemini 3.5 Transcribe जारी किया है, जो बुद्धिमान वॉइस इंटरैक्शन के लिए डिज़ाइन किया गया एक स्पीच-टू-टेक्स्ट मॉडल है जो कच्चे ऑडियो को सटीक और परिष्कृत टेक्स्ट में बदलता है, जबकि पृष्ठभूमि शोर और उच्चारण त्रुटियों को संभालता है।
- Artificial Analysis द्वारा मापे गए अनुसार, स्ट्रीमिंग के लिए 4.0% की औसत शब्द त्रुटि दर (WER) और नॉन-स्ट्रीमिंग उपयोग मामलों के लिए 2.6% प्राप्त करता है।
- पिछले Chirp 3 मॉडल की तुलना में अंतिम ट्रांसक्रिप्शन तक समय को 70% बेहतर बनाता है।
- स्वचालित पता लगाने के साथ 85 से अधिक भाषाओं का समर्थन करता है और विशेषज्ञ शब्दावली के लिए कस्टम शब्दकोश संभालता है।
- Live API के माध्यम से रियल-टाइम स्ट्रीमिंग और Interactions API के माध्यम से पूर्व-रिकॉर्डेड ऑडियो प्रसंस्करण प्रदान करता है।
- फ़ंक्शन कॉलिंग को सक्षम बनाता है ताकि छवि जनरेशन जैसे कार्यों को अन्य Gemini मॉडलों को सौंपा जा सके।
मॉडल Gemini API, Google AI Studio और Gemini Enterprise Agent Platform के माध्यम से पब्लिक प्रीव्यू में उपलब्ध है।