Google a déployé la compréhension vidéo agentic sur ses modèles Gemini Flash, remplaçant l'ancienne méthode de traitement statique par un système qui navigue dans les chronologies vidéo à la demande. Ce changement permet au modèle de décider quoi regarder, à quel taux d'images et via quelle modalité, plutôt que d'ingérer l'intégralité de la chronologie à un taux fixe d'une image par seconde.
- La nouvelle approche réduit l'utilisation des tokens jusqu'à 88 % et diminue les coûts jusqu'à 66 % tout en améliorant la précision sur les benchmarks vidéo standard jusqu'à 7 %.
- Gemini 3.7 Flash avec compréhension agentic se situe désormais sur la frontière de Pareado précision-coût pour l'analyse vidéo parmi les modèles testés.
- La fonctionnalité est activée via un seul champ « processing » dans l'API et prend en charge à la fois les téléchargements de fichiers et les URLs YouTube publiques.
- La comptabilisation des tokens distingue entre le raisonnement de navigation (tokens de réflexion) et les médias chargés (tokens d'utilisation d'outils).
Cette mise à jour permet aux développeurs de gérer plus efficacement les contenus longs sans la surcharge de développement liée à l'assemblage manuel de boucles de traitement, bien que le traitement statique reste recommandé pour les clips de moins de cinq minutes.