Googleは最新のGeminiモデル向けにエージェント型ビデオ理解を導入し、トークン使用量を最大88%削減しながら精度を最大7%向上させる動的分析を可能にしました。この機能により、モデルは固定レートでフレームを処理するのではなく、特定のビデオセグメントを積極的に検索・検査できます。
この機能はGoogle AI StudioおよびGemini Enterprise Agent PlatformのGemini APIを通じて利用可能です。主な機能には、サブ秒単位の瞬間取得、長文の「干し草の山から針」検索、異常検出、アクションやオブジェクトの正確なカウントが含まれます。早期アクセスパートナーからは強力なパフォーマンスが報告されており、Gemini 3.7 Flashが精度とコスト効率の両面で最良の結果を達成しました。
Googleは数ヶ月以内に数十億人のユーザー向けにGeminiアプリでこれらの改善を展開し、YouTubeの「Ask YouTube」機能を強化する予定です。