Benchmark · multimodal

LongVideoBench

0 résultats 0 modèles

LongVideoBench est un benchmark de questions à choix multiples qui évalue la capacité des modèles multimodaux à comprendre de longues vidéos sous-titrées (jusqu'à une heure), présentées sous forme d'images et de texte entrelacés. La performance se mesure par l'exactitude (accuracy) : le pourcentage de questions pour lesquelles le modèle choisit la bonne option.

En savoir plus
Exemple
Une question de type « referring reasoning » (raisonnement référentiel) sur une longue vidéo : l'énoncé contient une requête de référence désignant un moment précis (par ex. « la scène juste après que le présentateur ouvre la boîte rouge »), et le modèle doit retrouver ce moment parmi les images et sous-titres échantillonnés puis choisir la bonne option sur ce qui s'y passe.
Notation
La métrique est l'exactitude aux questions à choix multiples : score = (questions répondues correctement) / (total des questions). Une question n'est correcte que si l'option choisie correspond à l'unique option de référence. Les résultats sont aussi généralement ventilés selon les quatre groupes de durée (8–15 s, 15–60 s, 3–10 min, 15–60 min) et par catégorie de question.
Vérification
Une réponse est acceptée lorsque l'étiquette de l'option prédite correspond exactement à celle de référence. La partition de validation (1,337 questions) est fournie avec des réponses publiques, de sorte que l'exactitude peut être calculée localement ; les réponses de la partition de test sont masquées et évaluées via le classement officiel, si bien que les scores publiés utilisent la partition de validation.
Pourquoi c'est important
La plupart des benchmarks vidéo se résolvent à partir de quelques images ; la conception « referring reasoning » de LongVideoBench force le modèle à localiser et raisonner sur des détails précis enfouis dans des entrées entrelacées vidéo + sous-titres pouvant durer une heure, révélant comment l'exactitude se dégrade à mesure que les vidéos s'allongent et testant une véritable récupération multimodale à long contexte.
Exemple résolu
Tâche
Item représentatif. Entrée : images échantillonnées + sous-titres horodatés d'un vlog de cuisine d'environ 25 minutes. Question de type referring reasoning : Requête de référence : le moment où le présentateur ajoute du sel dans la poêle pour la première fois. Question : quel ingrédient le présentateur ajoute-t-il immédiatement après ce moment ? A) Ail B) Sucre C) Oignons hachés D) Huile d'olive E) Poivre noir
Solution
Localiser le moment référencé (le premier ajout de sel) parmi les images échantillonnées à l'aide des indices des sous-titres/de l'image ; examiner les images immédiatement suivantes ; identifier l'ingrédient ajouté ensuite. Option correcte : C) Oignons hachés.
Explication
La requête de référence fixe un unique moment d'ancrage, et une seule option correspond à ce que montrent réellement les images suivantes ; les distracteurs sont des ingrédients plausibles qui apparaissent ailleurs ou pas du tout, si bien que deviner sans retrouver le bon segment échoue. Notation : correspondance exacte de la lettre choisie avec l'option de référence ; l'item compte dans l'exactitude globale.

Aucun score vérifié pour ce benchmark à ce jour.