Google запустила агентное понимание видео во всех моделях Gemini Flash, заменив предыдущий метод статической обработки на систему, которая по запросу перемещается по временной шкале видео. Это изменение позволяет модели решать, что именно смотреть, с какой частотой кадров и через какой модальности, вместо того чтобы загружать всю временную шкалу с фиксированной скоростью один кадр в секунду.
- Новый подход сокращает использование токенов до 88% и снижает затраты до 66%, одновременно повышая точность на стандартных видео-бенчмарках до 7%.
- Gemini 3.7 Flash с агентным пониманием теперь находится на границе Парето «точность-стоимость» для анализа видео среди протестированных моделей.
- Функция активируется через одно поле "processing" в API и поддерживает как загрузку файлов, так и публичные ссылки YouTube.
- Учёт токенов разделяет рассуждения навигации (токены размышления) и загруженные медиаданные (токены использования инструментов).
Это обновление позволяет разработчикам более эффективно обрабатывать длинный контент без накладных расходов на ручную сборку циклов обработки, хотя для клипов длительностью до пяти минут по-прежнему рекомендуется статическая обработка.