Benchmark · multimodal
LongVideoBench
LongVideoBench est un benchmark de questions à choix multiples qui évalue la capacité des modèles multimodaux à comprendre de longues vidéos sous-titrées (jusqu'à une heure), présentées sous forme d'images et de texte entrelacés. La performance se mesure par l'exactitude (accuracy) : le pourcentage de questions pour lesquelles le modèle choisit la bonne option.
En savoir plus
- Exemple
- Une question de type « referring reasoning » (raisonnement référentiel) sur une longue vidéo : l'énoncé contient une requête de référence désignant un moment précis (par ex. « la scène juste après que le présentateur ouvre la boîte rouge »), et le modèle doit retrouver ce moment parmi les images et sous-titres échantillonnés puis choisir la bonne option sur ce qui s'y passe.
- Notation
- La métrique est l'exactitude aux questions à choix multiples : score = (questions répondues correctement) / (total des questions). Une question n'est correcte que si l'option choisie correspond à l'unique option de référence. Les résultats sont aussi généralement ventilés selon les quatre groupes de durée (8–15 s, 15–60 s, 3–10 min, 15–60 min) et par catégorie de question.
- Vérification
- Une réponse est acceptée lorsque l'étiquette de l'option prédite correspond exactement à celle de référence. La partition de validation (1,337 questions) est fournie avec des réponses publiques, de sorte que l'exactitude peut être calculée localement ; les réponses de la partition de test sont masquées et évaluées via le classement officiel, si bien que les scores publiés utilisent la partition de validation.
- Pourquoi c'est important
- La plupart des benchmarks vidéo se résolvent à partir de quelques images ; la conception « referring reasoning » de LongVideoBench force le modèle à localiser et raisonner sur des détails précis enfouis dans des entrées entrelacées vidéo + sous-titres pouvant durer une heure, révélant comment l'exactitude se dégrade à mesure que les vidéos s'allongent et testant une véritable récupération multimodale à long contexte.
Exemple résolu
Tâche
Item représentatif. Entrée : images échantillonnées + sous-titres horodatés d'un vlog de cuisine d'environ 25 minutes. Question de type referring reasoning :
Requête de référence : le moment où le présentateur ajoute du sel dans la poêle pour la première fois. Question : quel ingrédient le présentateur ajoute-t-il immédiatement après ce moment ?
A) Ail B) Sucre C) Oignons hachés D) Huile d'olive E) Poivre noir
Solution
Localiser le moment référencé (le premier ajout de sel) parmi les images échantillonnées à l'aide des indices des sous-titres/de l'image ; examiner les images immédiatement suivantes ; identifier l'ingrédient ajouté ensuite. Option correcte : C) Oignons hachés.
Explication
La requête de référence fixe un unique moment d'ancrage, et une seule option correspond à ce que montrent réellement les images suivantes ; les distracteurs sont des ingrédients plausibles qui apparaissent ailleurs ou pas du tout, si bien que deviner sans retrouver le bon segment échoue. Notation : correspondance exacte de la lettre choisie avec l'option de référence ; l'item compte dans l'exactitude globale.
Aucun score vérifié pour ce benchmark à ce jour.