Benchmark · multimodal
LongVideoBench
LongVideoBench es un benchmark de preguntas de opción múltiple que evalúa cómo de bien los modelos multimodales entienden vídeos largos con subtítulos (de hasta una hora), presentados como fotogramas y texto intercalados. El rendimiento se mide con la exactitud (accuracy): el porcentaje de preguntas en las que el modelo elige la opción correcta.
Leer más
- Ejemplo
- Una pregunta de 'referring reasoning' (razonamiento referencial) sobre un vídeo largo: el enunciado incluye una consulta que señala un momento concreto (p. ej., 'la escena justo después de que el presentador abre la caja roja'), y el modelo debe recuperar ese momento entre los fotogramas y subtítulos muestreados y elegir la opción correcta sobre lo que ocurre allí.
- Puntuación
- La métrica es la exactitud en preguntas de opción múltiple: puntuación = (preguntas respondidas correctamente) / (total de preguntas). Una pregunta es correcta solo cuando la opción elegida coincide con la única opción de referencia. Los resultados también suelen desglosarse por los cuatro grupos de duración (8–15 s, 15–60 s, 3–10 min, 15–60 min) y por categoría de pregunta.
- Verificación
- Una respuesta se acepta cuando la etiqueta de la opción predicha coincide exactamente con la de referencia. La partición de validación (1,337 preguntas) incluye respuestas públicas, por lo que la exactitud se puede calcular localmente; las respuestas de la partición de test están ocultas y se evalúan mediante la tabla de clasificación oficial, así que los resultados reportados públicamente usan la partición de validación.
- Por qué importa
- La mayoría de los benchmarks de vídeo se resuelven con unos pocos fotogramas; el diseño de 'referring reasoning' de LongVideoBench obliga al modelo a localizar y razonar sobre detalles concretos ocultos en entradas intercaladas de vídeo y subtítulos de hasta una hora, revelando cómo cae la exactitud a medida que los vídeos se alargan y poniendo a prueba una verdadera recuperación multimodal de contexto largo.
Ejemplo resuelto
Tarea
Ítem representativo. Entrada: fotogramas muestreados + subtítulos con marcas de tiempo de un vlog de cocina de ~25 minutos. Pregunta de tipo referring reasoning:
Consulta referencial: el momento en que el presentador añade sal a la sartén por primera vez. Pregunta: ¿qué ingrediente añade el presentador inmediatamente después de ese momento?
A) Ajo B) Azúcar C) Cebolla picada D) Aceite de oliva E) Pimienta negra
Solución
Localizar el momento referido (la primera vez que se añade sal) entre los fotogramas muestreados usando las pistas de subtítulos/imagen; examinar los fotogramas inmediatamente posteriores; identificar el siguiente ingrediente añadido. Opción correcta: C) Cebolla picada.
Explicación
La consulta referencial fija un único momento ancla, y solo una opción coincide con lo que muestran realmente los fotogramas siguientes; los distractores son ingredientes plausibles que aparecen en otro sitio o no aparecen, de modo que adivinar sin recuperar el segmento correcto falla. Evaluación: coincidencia exacta de la letra elegida con la opción de referencia; el ítem cuenta para la exactitud global.
Aún no hay puntuaciones verificadas para este benchmark.