أطلقت جوجل نموذج تحويل الكلام إلى نص Gemini 3.5 Transcribe، المصمم للتفاعلات الصوتية الذكية، والذي يحول الصوت الخام إلى نص دقيق ومُحسّن مع التعامل مع الضوضاء الخلفية والتهجئة غير الواضحة.

  • يحقق متوسط معدل خطأ الكلمات (WER) بنسبة 4.0% للدفق المباشر و2.6% لحالات الاستخدام غير المباشرة حسب قياسات Artificial Analysis.
  • يحسّن الوقت اللازم للحصول على النص النهائي بنسبة 70% مقارنةً بالنموذج السابق Chirp 3.
  • يدعم أكثر من 85 لغة مع الكشف التلقائي ويتعامل مع المفردات المخصصة للمصطلحات المتخصصة.
  • يوفر البث المباشر عبر Live API ومعالجة الصوت المسجل مسبقاً عبر Interactions API.
  • يتيح استدعاء الوظائف لتفويض مهام مثل توليد الصور إلى نماذج Gemini الأخرى.

النموذج متاح في النسخة التجريبية العامة عبر Gemini API وGoogle AI Studio ومنصة Gemini Enterprise Agent Platform.