A Google introduziu a compreensão de vídeo agêntico para seus mais recentes modelos Gemini, permitindo análise dinâmica que reduz o uso de tokens em até 88% enquanto melhora a precisão em até 7%. Essa capacidade permite que os modelos busquem e inspecionem ativamente segmentos específicos de vídeo, em vez de processar quadros a uma taxa fixa.

O recurso está disponível por meio da Gemini API no Google AI Studio e na plataforma Gemini Enterprise Agent Platform. As principais capacidades incluem recuperação de momentos em menos de um segundo, busca do tipo «agulha no palheiro» para conteúdos longos, detecção de anomalias e contagem precisa de ações e objetos. Parceiros de acesso antecipado relataram desempenho sólido, com o Gemini 3.7 Flash alcançando a melhor eficiência entre precisão e custo.

A Google planeja lançar essas melhorias para bilhões de usuários no aplicativo Gemini e usá-las para impulsionar o recurso 'Ask YouTube' do YouTube nos próximos meses.