Benchmark · multimodal
LongVideoBench
LongVideoBench 是一个多项选择问答基准,用于评估多模态模型对以帧和文本交错方式呈现的带字幕长视频(最长一小时)的理解能力。性能以准确率(accuracy)衡量,即模型选对选项的题目所占的百分比。
了解更多
- 示例
- 针对长视频的“指代推理(referring reasoning)”题:题干包含一个指向特定时刻的指代查询(例如“主持人打开红色盒子后紧接着的那个场景”),模型必须从采样的帧和字幕中找到该时刻,并就那里发生的事选出正确选项。
- 评分方式
- 指标是多项选择准确率:得分 =(答对的题目数)/(题目总数)。只有当模型所选选项与唯一的标准答案一致时,该题才算正确。结果通常还会按四个时长组(8–15 秒、15–60 秒、3–10 分钟、15–60 分钟)和题目类别分别统计。
- 验证方式
- 当预测的选项标签与标准答案标签完全一致时,答案被接受。验证集(1,337 题)附带公开答案,可在本地计算准确率;测试集答案被隐藏,通过官方排行榜评测,因此公开报告的分数使用验证集。
- 为何重要
- 大多数视频基准只需几帧即可作答;LongVideoBench 的“指代推理”设计迫使模型在长达一小时的视频加字幕交错输入中定位并推理隐藏的具体细节,揭示准确率如何随视频变长而下降,从而检验真正的长上下文多模态检索能力。
示例解析
任务
代表性样题。输入:来自约 25 分钟烹饪 vlog 的采样帧 + 带时间戳的字幕。指代推理题:
指代查询:主持人第一次往锅里加盐的那一刻。问题:紧接在那一刻之后,主持人加入了什么食材?
A) 大蒜 B) 糖 C) 切碎的洋葱 D) 橄榄油 E) 黑胡椒
解答
利用字幕/画面线索,在采样帧中定位被指代的时刻(第一次加盐);查看其紧随其后的帧;确定接下来加入的食材。正确选项:C) 切碎的洋葱。
解析
指代查询锁定唯一的锚点时刻,只有一个选项与随后帧中实际显示的内容相符;干扰项是出现在别处或根本没出现的貌似合理的食材,因此不检索正确片段而靠猜测会失败。评分:所选字母与标准选项精确匹配;该题计入总体准确率。
该 benchmark 暂无已验证的得分。