Googleは、Gemini Flashモデル全体でエージェント型動画理解機能をリリースし、従来の静的処理方式を、必要に応じて動画のタイムラインをナビゲートするシステムに置き換えた。この変更により、モデルは固定の1秒あたり1フレームで全体のタイムラインを取り込むのではなく、何を、どのフレームレートで、どのモーダリティを通じて視聴するかを決定できるようになった。
- 新しいアプローチにより、トークン使用量が最大88%削減され、コストが最大66%低下するとともに、標準的な動画ベンチマークでの精度が最大7%向上した。
- エージェント型理解機能を備えたGemini 3.7 Flashは、テストされたモデルの中で動画分析の精度対コストのパレート最適フロンティアに位置している。
- この機能はAPI内の単一の「processing」フィールドを介して有効化され、ファイルアップロードと公開YouTube URLの両方をサポートする。
- トークン集計では、ナビゲーション推論(思考トークン)と読み込まれたメディア(ツール使用トークン)が区別される。
このアップデートにより、開発者は手動で処理ループを組み立てる開発オーバーヘッドなしに長時間フォーマットコンテンツをより効率的に扱えるようになるが、5分未満のクリップについては静的処理が依然として推奨されている。