Benchmark · multimodal

CharXiv

5 条结果 5 个模型

CharXiv 是一个基准,用于测试多模态大语言模型对取自 arXiv 论文的真实科学图表的理解能力;它分别报告描述性问题(读取图表基本元素)和推理问题(比较与分析数值)的准确率。

了解更多
示例
给定一张图表图像,描述性任务可能要求读取标题、数出图例条目或说出某个刻度标签,而推理任务可能要求比较两条绘制的曲线并指出在某点上哪条更大——都只需依据图表的视觉内容即可作答。
评分方式
每个问题给出简短的自由格式答案。GPT-4o 充当自动评审,提取模型的答案并对照经人工验证的标准答案给出二元的正确/错误判定;分数即准确率(正确百分比),分别针对描述性子集和推理子集报告。
验证方式
全部 2,323 张图表及其问题和标准答案均由人类专家手工整理并核验;只有当 GPT-4o 评审判定回答与参考答案一致时,该回答才被接受为正确,而报告的人类准确率(推理约 80.5%)作为参考上限。
为何重要
读图对于将多模态大模型应用于科学论文和财报至关重要,但以往基准使用简单的模板化图表,夸大了进展;CharXiv 采用自然、多样的 arXiv 图表,揭示了最强模型与人类之间的巨大差距,使其成为对视觉推理的严苛而真实的考验。
示例解析
任务
[示意性推理题] 一张标题为「Validation Accuracy by Model Size」的分组柱状图。X 轴:模型规模(7B、13B、70B);Y 轴:准确率(%)。每组有两根柱,Dataset A 和 Dataset B:7B → A=61, B=58;13B → A=68, B=62;70B → A=79, B=71。问题(请给出简短答案):在哪个模型规模下,Dataset A 与 Dataset B 的准确率差距最大?
解答
各组差距 A − B:7B → 61 − 58 = 3;13B → 68 − 62 = 6;70B → 79 − 71 = 8。最大 = 8 → 答案:70B。
解析
这是一道推理题,因为需要读取全部六根柱的高度并比较其差值,而不仅是提取单个数值;GPT-4o 评审将简短答案对照标准答案「70B」并给出二元评分,计入推理准确率指标。
0 25 50 75 100 2024-06-20 2025-07-12 2026-08-03 Claude 3.5 Sonnet · 95.2 · 2024-06-20 o4-mini · 72 · 2025-04-17 GPT-5.2 Thinking · 88.7 · 2025-12-11 Inkling · 82 · 2026-07-17 Inkling-Small · 77.4 · 2026-08-03
Claude 3.5 Sonnet o4-mini GPT-5.2 Thinking Inkling Inkling-Small
时间线
日期 模型 得分 来源
2026-08-03 Inkling-Small 77.4% Thinking Machines Lab 发布 Inkling-Small,一款拥有 276B 开放权重的多模态 MoE 模型
2026-07-17 Inkling 82.0% Thinking Machines Lab发布Inkling:一个975B参数的开放权重多模态MoE模型
2025-12-11 GPT-5.2 Thinking 88.7% OpenAI发布GPT-5.2,在编码和推理基准测试中超越Gemini 3
2025-04-17 o4-mini 72.0% OpenAI发布o4-mini:一款更快、更便宜的多模态推理模型
2024-06-20 Claude 3.5 Sonnet 95.2% Anthropic发布Claude 3.5 Sonnet附录,提升编码与视觉基准表现