Бенчмарк · multimodal

CharXiv

5 результатов 5 моделей

CharXiv — это бенчмарк, проверяющий, насколько хорошо мультимодальные LLM понимают настоящие научные графики, взятые из статей arXiv; точность отдельно указывается для описательных вопросов (чтение базовых элементов графика) и вопросов на рассуждение (сравнение и анализ значений).

Подробнее
Пример
По изображению графика описательное задание может просить прочитать заголовок, посчитать записи в легенде или назвать подпись деления, а задание на рассуждение — сравнить два построенных ряда и сказать, какой больше в заданной точке; всё это решается только по визуальному содержимому графика.
Метрика
На каждый вопрос даётся короткий свободный ответ. GPT-4o выступает автоматическим судьёй: извлекает ответ модели и ставит бинарную оценку «верно/неверно» относительно проверенного человеком эталона; итог — точность (доля верных), отдельно для описательного и рассуждающего наборов.
Приёмка
Все 2 323 графика, их вопросы и эталонные ответы вручную составлены и проверены экспертами-людьми; ответ засчитывается как верный, только если судья GPT-4o признаёт его совпадающим с эталоном, а заявленная точность людей (около 80,5% на рассуждении) служит ориентиром-потолком.
Почему важно
Чтение графиков ключево при применении MLLM к научным статьям и финансовым отчётам, но прежние бенчмарки использовали простые шаблонные графики, завышавшие прогресс; естественные и разнообразные графики arXiv в CharXiv обнажают большой разрыв между лучшими моделями и людьми, делая его строгим и реалистичным тестом визуального рассуждения.
Разбор примера
Задача
[Иллюстративный пример на рассуждение] Сгруппированная столбчатая диаграмма с заголовком «Validation Accuracy by Model Size». Ось X: размер модели (7B, 13B, 70B); ось Y: точность (%). В каждой группе два столбца, Dataset A и Dataset B: 7B → A=61, B=58; 13B → A=68, B=62; 70B → A=79, B=71. Вопрос (дайте короткий ответ): для какого размера модели разрыв в точности между Dataset A и Dataset B наибольший?
Решение
Разрыв по группам A − B: 7B → 61 − 58 = 3; 13B → 68 − 62 = 6; 70B → 79 − 71 = 8. Наибольший = 8 → ответ: 70B.
Разбор
Это вопрос на рассуждение, потому что нужно прочитать все шесть высот столбцов и сравнить их разности, а не просто извлечь одно значение; судья GPT-4o сопоставляет короткий ответ с эталоном «70B» и выставляет бинарную оценку, влияющую на метрику точности рассуждения.
0 25 50 75 100 2024-06-20 2025-07-12 2026-08-03 Claude 3.5 Sonnet · 95.2 · 2024-06-20 o4-mini · 72 · 2025-04-17 GPT-5.2 Thinking · 88.7 · 2025-12-11 Inkling · 82 · 2026-07-17 Inkling-Small · 77.4 · 2026-08-03
Claude 3.5 Sonnet o4-mini GPT-5.2 Thinking Inkling Inkling-Small
Хронология
Дата Модель Результат Источник
2026-08-03 Inkling-Small 77.4% Thinking Machines Lab выпустила Inkling-Small: открытую мультимодальную MoE-модель с 276B весов
2026-07-17 Inkling 82.0% Thinking Machines Lab выпустила Inkling, мультимодальную MoE-модель с открытыми весами и 975B параметров
2025-12-11 GPT-5.2 Thinking 88.7% OpenAI выпустила GPT-5.2, превосходящую Gemini 3 в тестах по программированию и рассуждению
2025-04-17 o4-mini 72.0% OpenAI выпустила o4-mini: более быструю и дешёвую мультимодальную модель рассуждений
2024-06-20 Claude 3.5 Sonnet 95.2% Anthropic выпустила дополнение к Claude 3.5 Sonnet с улучшенными показателями в задачах программирования и зрения