O Google lançou a compreensão de vídeo agêntico em seus modelos Gemini Flash, substituindo o método anterior de processamento estático por um sistema que navega pelas linhas do tempo dos vídeos sob demanda. Essa mudança permite que o modelo decida o que assistir, a qual taxa de quadros e por qual modalidade, em vez de ingerir toda a linha do tempo em uma única taxa fixa de um quadro por segundo.
- A nova abordagem reduz o uso de tokens em até 88% e diminui os custos em até 66%, ao mesmo tempo que melhora a precisão nos benchmarks padrão de vídeo em até 7%.
- O Gemini 3.7 Flash com compreensão agêntica agora ocupa a fronteira de Pareto entre precisão e custo para análise de vídeo entre os modelos testados.
- O recurso é ativado por meio de um único campo "processing" na API e suporta tanto uploads de arquivos quanto URLs públicas do YouTube.
- A contabilidade de tokens distingue entre o raciocínio de navegação (tokens de pensamento) e a mídia carregada (tokens de uso de ferramenta).
Esta atualização permite que os desenvolvedores lidem com conteúdo de longa duração de forma mais eficiente, sem a sobrecarga de desenvolvimento necessária para montar manualmente loops de processamento, embora o processamento estático continue sendo recomendado para clipes com menos de cinco minutos.