Google представила агентное понимание видео для своих новейших моделей Gemini, что позволяет проводить динамический анализ, сокращающий использование токенов до 88% при одновременном повышении точности до 7%. Эта возможность позволяет моделям активно искать и проверять конкретные сегменты видео, а не обрабатывать кадры с фиксированной частотой.

Функция доступна через Gemini API в Google AI Studio и платформе Gemini Enterprise Agent Platform. Ключевые возможности включают извлечение моментов за доли секунды, поиск «иголки в стоге сена» для длинных форм, обнаружение аномалий и точный подсчет действий и объектов. Партнеры по раннему доступу сообщили о высокой эффективности, при этом Gemini 3.7 Flash показала наилучшее соотношение точности и стоимости.

Google планирует внедрить эти улучшения в приложение Gemini для миллиардов пользователей, а также использовать их для функции «Ask YouTube» на YouTube в ближайшие месяцы.