أطلقت جوجل نموذج تحويل الكلام إلى نص Gemini 3.5 Transcribe، المصمم للتفاعلات الصوتية الذكية، والذي يحول الصوت الخام إلى نص دقيق ومُحسّن مع التعامل مع الضوضاء الخلفية والتهجئة غير الواضحة.
- يحقق متوسط معدل خطأ الكلمات (WER) بنسبة 4.0% للدفق المباشر و2.6% لحالات الاستخدام غير المباشرة حسب قياسات Artificial Analysis.
- يحسّن الوقت اللازم للحصول على النص النهائي بنسبة 70% مقارنةً بالنموذج السابق Chirp 3.
- يدعم أكثر من 85 لغة مع الكشف التلقائي ويتعامل مع المفردات المخصصة للمصطلحات المتخصصة.
- يوفر البث المباشر عبر Live API ومعالجة الصوت المسجل مسبقاً عبر Interactions API.
- يتيح استدعاء الوظائف لتفويض مهام مثل توليد الصور إلى نماذج Gemini الأخرى.
النموذج متاح في النسخة التجريبية العامة عبر Gemini API وGoogle AI Studio ومنصة Gemini Enterprise Agent Platform.