Бенчмарк · multimodal

MathVista

5 результатов 5 моделей

MathVista — это мультимодальный бенчмарк, оценивающий математические рассуждения по визуальным данным: рисункам, диаграммам, геометрическим чертежам и научным графикам. Результат выражается как accuracy (точность) — доля верно отвеченных вопросов.

Подробнее
Пример
Типовое задание сочетает изображение — геометрический чертёж, график функции, столбчатую диаграмму или таблицу — с вопросом, который решается только через считывание мелких визуальных деталей и последующие математические рассуждения, например вычисление длины по подписанному чертежу или считывание значения с диаграммы. Задания бывают с выбором ответа или со свободным ответом (целое число, дробь или список).
Метрика
Метрика — accuracy (точность). Поскольку ответы свободные или с выбором варианта, LLM сначала извлекает короткий итоговый ответ из полного ответа модели; он нормализуется и сравнивается с эталоном по точному совпадению. Точность — доля верных заданий, также приводимая с разбивкой по типам задач и видам рассуждений.
Приёмка
Оценка использует две подвыборки: набор testmini из 1000 заданий с открытыми ответами для локальной проверки и больший набор test примерно из 5141 задания, ответы к которому скрыты и оцениваются только при отправке предсказаний на официальный лидерборд. Результат засчитывается верным, если конвейер извлечения ответа и точного совпадения его принимает.
Почему важно
Текстовые математические бенчмарки и обычные бенчмарки визуальных вопросов-ответов по отдельности упускают то, на что нацелен MathVista: математику, невозможную без настоящего визуального понимания. Он выявил большой разрыв между моделями и людьми и стал стандартным мерилом визуальных математических рассуждений мультимодальных базовых моделей.
Разбор примера
Задача
Изображение: прямоугольный треугольник с двумя катетами, подписанными 6 и 8. Вопрос: «Чему равна длина гипотенузы на рисунке?» Тип ответа: свободное целое число.
Решение
По теореме Пифагора гипотенуза c = √(6² + 8²) = √(36 + 64) = √100 = 10. Итоговый ответ: 10.
Разбор
Для решения нужно считать подписанные длины сторон с чертежа (визуальное понимание), а затем применить теорему Пифагора (математическое рассуждение). Оценивание: LLM извлекает краткий ответ «10» из отклика модели, и он сопоставляется с эталоном по нормализованному точному совпадению.
0 22.5 45 67.5 90 2024-06-20 2025-07-17 2026-08-13 Claude 3.5 Sonnet · 67.7 · 2024-06-20 Kimi k1.5 · 74.9 · 2025-01-22 o4-mini · 84.3 · 2025-04-17 Alita · 74 · 2025-05-26 LFM2.5-VL-3B · 68.5 · 2026-08-13
Claude 3.5 Sonnet Kimi k1.5 o4-mini Alita LFM2.5-VL-3B
Хронология
Дата Модель Результат Источник
2026-08-13 LFM2.5-VL-3B 68.5% Liquid AI выпустила LFM2.5-VL-3B: 3-миллиардную модель для распознавания изображений и текста на устройстве с поддержкой вызова инструментов
2025-05-26 Alita 74.0% Alita обеспечивает масштабируемое агентное рассуждение с минимальным предварительным определением и максимальной саморазвиваемостью
2025-04-17 o4-mini 84.3% OpenAI выпустила o4-mini: более быструю и дешёвую мультимодальную модель рассуждений
2025-01-22 Kimi k1.5 74.9% Kimi k1.5 масштабирует обучение с подкреплением на основе LLM для достижения уровня o1 и превосходства над моделями с коротким цепочечным мышлением
2024-06-20 Claude 3.5 Sonnet 67.7% Anthropic выпустила дополнение к Claude 3.5 Sonnet с улучшенными показателями в задачах программирования и зрения