أطلقت جوجل الفهم الواعي للفيديو عبر نماذج Gemini Flash الخاصة بها، مستبدلةً طريقة المعالجة الثابتة السابقة بنظام يتنقل في خطوط الزمن الفيديوية عند الطلب. يتيح هذا التغيير للنموذج أن يقرر ما يشاهده، وبأي معدل إطارات، وعن طريق أي وسيط، بدلاً من استيعاب خط الزمن بأكمله بمعدل ثابت قدره إطار واحد في الثانية.

  • يقلل النهج الجديد من استخدام الرموز (tokens) بنسبة تصل إلى 88% ويخفض التكاليف بنسبة تصل إلى 66% مع تحسين الدقة في معايير الفيديو القياسية بنسبة تصل إلى 7%.
  • يتصدر Gemini 3.7 Flash مع الفهم الواعي الآن حدود باريتو للدقة مقابل التكلفة لتحليل الفيديو بين النماذج المختبرة.
  • يتم تمكين الميزة عبر حقل "processing" واحد في واجهة برمجة التطبيقات (API) ويدعم كلًا من تحميل الملفات وروابط YouTube العامة.
  • يميز حساب الرموز بين استدلال التنقل (رموز التفكير) والوسائط المحملة (رموز استخدام الأدوات).

يتيح هذا التحديث للمطورين التعامل مع المحتوى طويل المدى بكفاءة أكبر دون عبء التطوير الناتج عن تجميع حلقات المعالجة يدويًا، على الرغم من أن المعالجة الثابتة لا تزال موصى بها للقطع التي تقل مدتها عن خمس دقائق.