Бенчмарк · multimodal

Video-MME

4 результатов 3 моделей

Video-MME — это комплексный бенчмарк для оценки мультимодальных LLM в понимании видео: коротких, средних и длинных. Результат выражается как точность на вопросах с выбором ответа — 2 700 размеченных вручную вопросов к 900 видео (254 часа) из шести визуальных доменов.

Подробнее
Пример
Модель смотрит видеофрагмент (при желании — с дорожками субтитров и аудио) и отвечает на вопрос с четырьмя вариантами ответа, требующий рассуждения о визуальном содержании во времени, — например, определить порядок событий в спортивном ролике средней длины.
Метрика
Метрика — точность (accuracy): доля вопросов с четырьмя вариантами, на которые дан верный ответ. Результаты обычно приводят и без субтитров, и с ними, с разбивкой по длительности видео (короткие/средние/длинные) и доменам, а затем усредняют в общий показатель.
Приёмка
Выбранная моделью буква (A/B/C/D) извлекается из её вывода и сравнивается точным совпадением с эталонным ответом, размеченным экспертами; доля верных и есть точность. Все видео и вопросы собраны и размечены вручную, чтобы минимизировать утечку данных, поэтому цифры сопоставимы в публичном лидерборде.
Почему важно
Это был первый комплексный бенчмарк, проверяющий мультимодальные LLM на реальных видео широкого диапазона длительности (до примерно часа) и в разнообразных доменах с использованием нескольких модальностей (кадры, субтитры, аудио) — выявляя настоящее временно́е рассуждение и понимание длинных видео, а не распознавание по одному кадру.
Разбор примера
Задача
Даётся фрагмент средней длины (~10 мин) из домена «Знания» вместе с дорожкой субтитров. Вопрос: «Какую главную причину широкого распространения описанной методики называет ведущий?» Варианты: A) Она была дешевле альтернатив; B) Она не требовала специальной подготовки; C) Она давала более стабильные результаты; D) Она была предписана законом. (Иллюстративный пример в формате бенчмарка.)
Решение
Сопоставьте визуальный ряд с субтитрами/аудиокомментарием, отбросьте три варианта, не подтверждённые роликом, и выберите подтверждённый. Итоговый ответ: C.
Разбор
Вопросы Video-MME — с одним верным ответом из четырёх, поэтому ровно один вариант (C) соответствует свидетельствам из ролика; оценка — точное совпадение буквы с эталонной меткой экспертов, метрика accuracy (верные ÷ всего).
0 25 50 75 100 2024-06-20 2025-03-05 2025-11-18 Claude 3.5 Sonnet · 94.7 · 2024-06-20 Gemini 2.5 06-05 · 84.8 · 2025-06-05 Gemini 3 Pro · 87.6 · 2025-11-18 Gemini 3 Pro · 87.6 · 2025-11-18
Claude 3.5 Sonnet Gemini 2.5 06-05 Gemini 3 Pro
Хронология
Дата Модель Результат Источник
2025-11-18 Gemini 3 Pro 87.6% Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
2025-11-18 Gemini 3 Pro 87.6% Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
2025-06-05 Gemini 2.5 06-05 84.8% Google выпустила превью Gemini 2.5 06-05 с улучшениями в области программирования и рассуждений
2024-06-20 Claude 3.5 Sonnet 94.7% Anthropic выпустила дополнение к Claude 3.5 Sonnet с улучшенными показателями в задачах программирования и зрения