Google AI ने Gemini 3.5 Transcribe जारी किया है, जो एक स्पीच-टू-टेक्स्ट मॉडल है जो दो अलग-अलग API एंडपॉइंट्स के माध्यम से उपलब्ध है: पूर्व-रिकॉर्डेड फ़ाइलों के लिए Interactions API और रियल-टाइम स्ट्रीमिंग के लिए Live API।
- Artificial Analysis द्वारा मापने पर, मॉडल ने नॉन-स्ट्रीमिंग के लिए 2.6% की औसत शब्द त्रुटि दर (WER) और स्ट्रीमिंग के लिए 4.0% दर्ज की है।
- पिछले Chirp 3 मॉडल की तुलना में अंतिम ट्रांसक्रिप्शन प्राप्त करने का समय 70% बेहतर हुआ है।
- स्वचालित डिटेक्शन में मध्य-वाक्य कोड-स्विचिंग सहित 85 से अधिक भाषाओं का समर्थन शामिल है।
- Live API सब-सेकंड लेटेंसी प्रदान करता है, लेकिन इसमें स्पीकर डायरिज़ेशन और शब्द-स्तरीय टाइमस्टैम्प्स की कमी है, जो Interactions API में उपलब्ध हैं।
- स्मार्ट मोड डिस्फ्लुएन्सीज को हटा देता है, लेकिन इसे टाइमस्टैम्प्स या डायरिज़ेशन के साथ संयोजित नहीं किया जा सकता।
एंडपॉइंट्स के बीच यह विभाजन डेवलपर्स को लाइव इंटरफ़ेस के लिए कम लेटेंसी वाली स्ट्रीमिंग या पोस्ट-प्रोसेसिंग के लिए विस्तृत ट्रांसक्रिप्शन सुविधाओं के बीच चुनने की अनुमति देता है।