벤치마크 · multimodal

LongVideoBench

0 결과 0 모델

LongVideoBench는 프레임과 텍스트가 번갈아 제시되는 자막 포함 장시간 영상(최대 1시간)을 멀티모달 모델이 얼마나 잘 이해하는지 평가하는 객관식 질의응답 벤치마크입니다. 성능은 정확도(accuracy), 즉 모델이 정답 선택지를 고른 문항의 비율로 측정됩니다.

자세히 보기
예시
장시간 영상에 대한 'referring reasoning(참조 추론)' 유형 문항: 문제에는 특정 순간을 가리키는 참조 질의가 포함되며(예: '진행자가 빨간 상자를 연 직후 장면'), 모델은 샘플링된 프레임과 자막에서 그 순간을 찾아 그곳에서 무슨 일이 일어나는지에 대한 올바른 선택지를 골라야 합니다.
채점 방식
지표는 객관식 정확도입니다: 점수 =(맞힌 문항 수)/(전체 문항 수). 모델이 고른 선택지가 유일한 정답과 일치할 때만 해당 문항이 정답으로 집계됩니다. 결과는 보통 네 개의 길이 그룹(8~15초, 15~60초, 3~10분, 15~60분)과 문항 범주별로도 세분화됩니다.
검증 방식
예측한 선택지 라벨이 정답 라벨과 정확히 일치할 때 답이 인정됩니다. 검증 분할(1,337문항)은 공개 정답과 함께 제공되어 정확도를 로컬에서 계산할 수 있으며, 테스트 분할의 정답은 비공개로 공식 리더보드를 통해 채점되므로 공개적으로 보고되는 점수는 검증 분할을 사용합니다.
왜 중요한가
대부분의 영상 벤치마크는 몇 프레임만으로 풀 수 있지만, LongVideoBench의 'referring reasoning' 설계는 최대 1시간짜리 영상+자막 교차 입력 속에 묻힌 특정 세부 정보를 모델이 찾아내 추론하도록 강제합니다. 이로써 영상이 길어질수록 정확도가 어떻게 떨어지는지를 드러내고, 진정한 장문맥 멀티모달 검색 능력을 시험합니다.
예제 풀이
문제
대표 예시 문항. 입력: 약 25분 분량 요리 브이로그에서 샘플링한 프레임 + 타임스탬프가 있는 자막. referring reasoning 유형 문항: 참조 질의: 진행자가 팬에 처음으로 소금을 넣는 순간. 질문: 그 순간 직후에 진행자가 넣는 재료는 무엇입니까? A) 마늘 B) 설탕 C) 다진 양파 D) 올리브유 E) 후추
해답
자막/화면 단서를 이용해 샘플링된 프레임에서 참조된 순간(처음 소금을 넣는 장면)을 찾는다; 그 직후 프레임을 살핀다; 다음에 넣는 재료를 식별한다. 정답 선택지: C) 다진 양파.
풀이
참조 질의가 유일한 기준 순간을 고정하며, 이어지는 프레임이 실제로 보여 주는 내용과 일치하는 선택지는 하나뿐입니다; 오답은 다른 곳에 등장하거나 아예 등장하지 않는 그럴듯한 재료이므로, 올바른 구간을 찾지 않고 추측하면 틀립니다. 채점: 고른 문자와 정답 선택지의 정확한 일치이며, 이 문항은 전체 정확도에 반영됩니다.

이 벤치마크에 대해 아직 검증된 점수가 없습니다.