Google ha introducido la comprensión de video agéntico para sus últimos modelos Gemini, lo que permite un análisis dinámico que reduce el uso de tokens hasta en un 88% mientras mejora la precisión hasta en un 7%. Esta capacidad permite a los modelos buscar e inspeccionar activamente segmentos específicos de video en lugar de procesar fotogramas a una tasa fija.

La función está disponible a través de Gemini API en Google AI Studio y en la plataforma Gemini Enterprise Agent Platform. Las capacidades clave incluyen recuperación de momentos en menos de un segundo, búsqueda de «aguja en un pajar» para contenido largo, detección de anomalías y conteo preciso de acciones y objetos. Los socios de acceso anticipado reportaron un rendimiento sólido, con Gemini 3.7 Flash logrando la mejor eficiencia entre precisión y costo.

Google planea implementar estas mejoras en la aplicación Gemini para miles de millones de usuarios y potenciará la función 'Ask YouTube' de YouTube en los próximos meses.