Google a introduit la compréhension vidéo agentic pour ses derniers modèles Gemini, permettant une analyse dynamique qui réduit l'utilisation de tokens jusqu'à 88 % tout en améliorant la précision jusqu'à 7 %. Cette capacité permet aux modèles de rechercher et d'inspecter activement des segments vidéo spécifiques plutôt que de traiter les images à un taux fixe.
La fonctionnalité est disponible via l'API Gemini dans Google AI Studio et sur la plateforme Gemini Enterprise Agent Platform. Les capacités clés incluent la récupération de moments en moins d'une seconde, la recherche du « type aiguille dans une botte de foin » pour les contenus longs, la détection d'anomalies et le comptage précis des actions et objets. Les partenaires d'accès anticipé ont signalé de solides performances, avec Gemini 3.7 Flash atteignant le meilleur rapport précision-coût.
Google prévoit de déployer ces améliorations dans l'application Gemini pour des milliards d'utilisateurs et d'alimenter la fonctionnalité « Ask YouTube » de YouTube dans les mois à venir.