أعلنت جوجل عن إطلاق Gemini 3.8 Live وGemini 3.8 Live Extended Thinking، وهما نماذج أصلية لتحويل الكلام إلى كلام مصممة لوكلاء الصوت في الوقت الفعلي الذين يعقلون وينفذون الأدوات دون مقاطعة تدفق المحادثة.

  • كلا النموذجين متاحان الآن في Gemini Live API وGoogle AI Studio كحلول مستضافة.
  • يركز Gemini 3.8 Live على القفاءة من حيث التكلفة، بينما تضيف Extended Thinking قدرات الاستدلال متعدد الخطوات.
  • تحتل Extended Thinking المرتبة الأولى في مؤشر جودة تحويل الكلام إلى كلام من Artificial Analysis بنتيجة 82.6.
  • تدعم النماذج استدعاء الوظائف غير المتزامن، والسياق البصري، والدقة الرقمية والحرفية، و97 لغة.
  • تم تحديد الأسعار عند $0.005/دقيقة لإدخال الصوت و$0.018/دقيقة لإخراج الصوت عبر Live API.

توفر هذه الإصدارات بديلاً مبسطاً لخطوط أنابيب الكلام المتسلسلة، مما يمكّن المطورين من بناء وكلاء صوت على مستوى الإنتاج مع استخدام مدمج للأدوات وزمن استجابة منخفض.