أطلقت Google AI نموذج Gemini 3.5 Transcribe، وهو نموذج لتحويل الكلام إلى نص متاح عبر نقطتي نهاية API مختلفتين: واجهة برمجة التطبيقات الخاصة بالتفاعلات (Interactions API) للملفات المسجلة مسبقًا، وواجهة برمجة التطبيقات المباشرة (Live API) للبث المباشر في الوقت الفعلي.
- يبلغ معدل خطأ الكلمات المتوسط للنموذج 2.6% للنصوص غير المتدفقة و4.0% للنصوص المتدفقة، وفقًا لقياسات Artificial Analysis.
- تحسّن وقت الحصول على النص النهائي بنسبة 70% مقارنةً بالنموذج السابق Chirp 3.
- يدعم الكشف التلقائي أكثر من 85 لغة، بما في ذلك التبديل بين اللغات داخل الجملة.
- توفر واجهة برمجة التطبيقات المباشرة (Live API) زمن استجابة أقل من ثانية واحدة، لكنها تفتقر إلى تحديد المتحدثين (speaker diarization) والطوابع الزمنية على مستوى الكلمات، وهي متاحة في واجهة برمجة التطبيقات الخاصة بالتفاعلات.
- يزيل الوضع الذكي (Smart mode) الترددات الكلامية، لكنه لا يمكن دمجه مع الطوابع الزمنية أو تحديد المتحدثين.
يُتيح التقسيم بين نقطتي النهاية للمطورين الاختيار بين البث منخفض زمن الاستجابة للواجهات المباشرة أو ميزات النص التفصيلية للمعالجة اللاحقة.