Benchmark · multimodal

LongVideoBench

0 resultados 0 modelos

LongVideoBench é um benchmark de perguntas de múltipla escolha que avalia o quão bem modelos multimodais entendem vídeos longos com legendas (de até uma hora), apresentados como quadros e texto intercalados. O desempenho é medido pela acurácia (accuracy): o percentual de perguntas em que o modelo escolhe a opção correta.

Saiba mais
Exemplo
Uma pergunta de 'referring reasoning' (raciocínio referencial) sobre um vídeo longo: o enunciado inclui uma consulta que aponta para um momento específico (por exemplo, 'a cena logo depois de o apresentador abrir a caixa vermelha'), e o modelo precisa recuperar esse momento entre os quadros e legendas amostrados e escolher a opção correta sobre o que acontece ali.
Pontuação
A métrica é a acurácia em perguntas de múltipla escolha: pontuação = (perguntas respondidas corretamente) / (total de perguntas). Uma pergunta é correta apenas quando a opção escolhida coincide com a única opção de referência. Os resultados também costumam ser detalhados pelos quatro grupos de duração (8–15 s, 15–60 s, 3–10 min, 15–60 min) e por categoria de pergunta.
Verificação
Uma resposta é aceita quando o rótulo da opção prevista coincide exatamente com o de referência. A partição de validação (1,337 perguntas) traz respostas públicas, então a acurácia pode ser calculada localmente; as respostas da partição de teste ficam ocultas e são avaliadas pelo placar oficial, de modo que os resultados divulgados publicamente usam a partição de validação.
Por que importa
A maioria dos benchmarks de vídeo pode ser resolvida com poucos quadros; o design de 'referring reasoning' do LongVideoBench obriga o modelo a localizar e raciocinar sobre detalhes específicos escondidos em entradas intercaladas de vídeo e legendas de até uma hora, revelando como a acurácia cai à medida que os vídeos ficam mais longos e testando uma verdadeira recuperação multimodal de contexto longo.
Exemplo resolvido
Tarefa
Item representativo. Entrada: quadros amostrados + legendas com marcação de tempo de um vlog de culinária de ~25 minutos. Pergunta do tipo referring reasoning: Consulta referencial: o momento em que o apresentador adiciona sal à frigideira pela primeira vez. Pergunta: qual ingrediente o apresentador adiciona imediatamente após esse momento? A) Alho B) Açúcar C) Cebola picada D) Azeite de oliva E) Pimenta-do-reino
Solução
Localizar o momento referido (a primeira adição de sal) entre os quadros amostrados usando as pistas das legendas/imagem; examinar os quadros imediatamente seguintes; identificar o próximo ingrediente adicionado. Opção correta: C) Cebola picada.
Explicação
A consulta referencial fixa um único momento-âncora, e apenas uma opção corresponde ao que os quadros seguintes realmente mostram; os distratores são ingredientes plausíveis que aparecem em outro lugar ou não aparecem, então adivinhar sem recuperar o trecho certo falha. Avaliação: correspondência exata da letra escolhida com a opção de referência; o item conta para a acurácia geral.

Ainda não há pontuações verificadas para este benchmark.