Google ha lanzado la comprensión de video agéntico en sus modelos Gemini Flash, reemplazando el método de procesamiento estático anterior con un sistema que navega por las líneas de tiempo de los videos bajo demanda. Este cambio permite que el modelo decida qué ver, a qué tasa de fotogramas y a través de qué modalidad, en lugar de ingerir toda la línea de tiempo a una fija de un fotograma por segundo.
- El nuevo enfoque reduce el uso de tokens hasta en un 88% y disminuye los costos hasta en un 66% mientras mejora la precisión en los benchmarks estándar de video hasta en un 7%.
- Gemini 3.7 Flash con comprensión agéntica ahora se sitúa en la frontera de Pareto de precisión-coste para el análisis de video entre los modelos probados.
- La función se habilita mediante un único campo "processing" en la API y admite tanto cargas de archivos como URLs públicas de YouTube.
- La contabilidad de tokens distingue entre el razonamiento de navegación (tokens de pensamiento) y los medios cargados (tokens de uso de herramientas).
Esta actualización permite a los desarrolladores manejar contenido de formato largo de manera más eficiente sin la sobrecarga de desarrollo de ensamblar manualmente bucles de procesamiento, aunque se sigue recomendando el procesamiento estático para clips de menos de cinco minutos.