Google telah meluncurkan pemahaman video agentic di seluruh model Gemini Flash-nya, menggantikan metode pemrosesan statis sebelumnya dengan sistem yang menavigasi garis waktu video sesuai permintaan. Perubahan ini memungkinkan model memutuskan apa yang akan ditonton, pada frame rate berapa, dan melalui modalitas mana, alih-alih mengimpor seluruh garis waktu pada satu frame per detik secara tetap.

  • Pendekatan baru mengurangi penggunaan token hingga 88% dan menurunkan biaya hingga 66% sambil meningkatkan akurasi pada benchmark video standar hingga 7%.
  • Gemini 3.7 Flash dengan pemahaman agentic kini berada di front Pareto akurasi-terhadap-biaya untuk analisis video di antara model yang diuji.
  • Fitur ini diaktifkan melalui satu bidang "processing" di API dan mendukung unggahan file serta URL YouTube publik.
  • Akuntansi token membedakan antara penalaran navigasi (token pemikiran) dan media yang dimuat (token penggunaan alat).

Pembaruan ini memungkinkan pengembang menangani konten berdurasi panjang lebih efisien tanpa overhead pengembangan dari perakitan manual loop pemrosesan, meskipun pemrosesan statis tetap direkomendasikan untuk klip di bawah lima menit.