Benchmark · multimodal

MathVista

5 条结果 5 个模型

MathVista 是一个多模态基准,衡量对视觉输入(图形、图表、几何示意图和科学曲线图)的数学推理能力。成绩以 accuracy(准确率)报告,即正确回答问题的比例。

了解更多
示例
一个典型题目将一张图像(几何示意图、函数图像、条形图或表格)与一个只能通过读取细粒度视觉细节再进行数学推理才能解答的问题配对,例如根据带标注的图形计算长度,或从图表中读取数值。题目为多项选择或自由作答(整数、小数或列表)。
评分方式
指标为 accuracy(准确率)。由于答案是自由作答或多项选择,先由一个 LLM 从模型的完整回答中抽取简短的最终答案;将其规范化后与标准答案做精确匹配。准确率即答对题目的比例,同时按任务类型和推理类型分别报告。
验证方式
评测使用两个划分:包含 1000 道题、答案公开的 testmini 集用于本地评分;以及约 5141 道题的较大 test 集,其答案不公开,只有向官方评测排行榜提交预测才能评分。当答案抽取加精确匹配的流程判定其正确时,该结果才计为正确。
为何重要
纯文本数学基准和通用视觉问答基准各自都遗漏了 MathVista 所针对的交叉领域:离开真正的视觉理解就无法完成的数学。它揭示了模型与人类之间的巨大差距,并成为衡量多模态基础模型视觉数学推理能力的标准尺度。
示例解析
任务
图像:一个直角三角形,两条直角边分别标注为 6 和 8。问题:“图中斜边的长度是多少?”答案类型:自由作答整数。
解答
根据勾股定理,斜边 c = √(6² + 8²) = √(36 + 64) = √100 = 10。最终答案:10。
解析
解题需要先从示意图中读出标注的边长(视觉理解),再运用勾股定理(数学推理)。评分:由一个 LLM 从模型回答中抽取简短答案“10”,再与标准答案做规范化后的精确匹配。
0 22.5 45 67.5 90 2024-06-20 2025-07-17 2026-08-13 Claude 3.5 Sonnet · 67.7 · 2024-06-20 Kimi k1.5 · 74.9 · 2025-01-22 o4-mini · 84.3 · 2025-04-17 Alita · 74 · 2025-05-26 LFM2.5-VL-3B · 68.5 · 2026-08-13
Claude 3.5 Sonnet Kimi k1.5 o4-mini Alita LFM2.5-VL-3B
时间线
日期 模型 得分 来源
2026-08-13 LFM2.5-VL-3B 68.5% Liquid AI 发布 LFM2.5-VL-3B,一款支持工具调用的 3B 端侧视觉语言模型
2025-05-26 Alita 74.0% Alita 以极少的预定义和最大的自我进化实现可扩展的智能体推理
2025-04-17 o4-mini 84.3% OpenAI发布o4-mini:一款更快、更便宜的多模态推理模型
2025-01-22 Kimi k1.5 74.9% Kimi k1.5 利用大语言模型扩展强化学习,性能匹敌 o1 并超越短链式思考模型
2024-06-20 Claude 3.5 Sonnet 67.7% Anthropic发布Claude 3.5 Sonnet附录,提升编码与视觉基准表现