Benchmark · multimodal

CharXiv

5 resultados 5 modelos

CharXiv é um benchmark que testa quão bem os LLMs multimodais entendem gráficos científicos reais extraídos de artigos do arXiv; ele reporta a acurácia separadamente para perguntas descritivas (ler elementos básicos do gráfico) e perguntas de raciocínio (comparar e analisar valores).

Saiba mais
Exemplo
Dada a imagem de um gráfico, uma tarefa descritiva pode pedir para ler o título, contar as entradas da legenda ou indicar o rótulo de uma marca, enquanto uma tarefa de raciocínio pode pedir para comparar duas séries plotadas e dizer qual é maior em um ponto dado — sempre respondível apenas pelo conteúdo visual do gráfico.
Pontuação
Cada pergunta recebe uma resposta curta de formato livre. O GPT-4o atua como juiz automático que extrai a resposta do modelo e atribui um valor binário correto/incorreto em relação ao gabarito validado por humanos; a pontuação é a acurácia (porcentagem de acertos), reportada separadamente para os subconjuntos descritivo e de raciocínio.
Verificação
Os 2.323 gráficos, suas perguntas e as respostas de referência são todos curados à mão e verificados por especialistas humanos; uma resposta é aceita como correta somente quando o avaliador GPT-4o a julga coincidente com a referência, e a acurácia humana reportada (cerca de 80,5% em raciocínio) serve como teto de referência.
Por que importa
Ler gráficos é central para aplicar MLLMs a artigos científicos e relatórios financeiros, mas benchmarks anteriores usavam gráficos simples e baseados em modelos que superestimavam o progresso; os gráficos naturais e diversos do arXiv no CharXiv revelam uma grande lacuna entre os melhores modelos e os humanos, tornando-o um teste exigente e realista de raciocínio visual.
Exemplo resolvido
Tarefa
[Item ilustrativo de raciocínio] Um gráfico de barras agrupadas intitulado «Validation Accuracy by Model Size». Eixo X: tamanho do modelo (7B, 13B, 70B); eixo Y: acurácia (%). Cada grupo tem duas barras, Dataset A e Dataset B: 7B → A=61, B=58; 13B → A=68, B=62; 70B → A=79, B=71. Pergunta (dê uma resposta curta): para qual tamanho de modelo a diferença de acurácia entre Dataset A e Dataset B é a maior?
Solução
Diferença por grupo A − B: 7B → 61 − 58 = 3; 13B → 68 − 62 = 6; 70B → 79 − 71 = 8. Maior = 8 → resposta: 70B.
Explicação
É uma pergunta de raciocínio porque é preciso ler as seis alturas de barra e comparar suas diferenças, não apenas extrair um valor; o juiz GPT-4o mapeia a resposta curta para o gabarito «70B» e a pontua de forma binária, contribuindo para a métrica de acurácia de raciocínio.
0 25 50 75 100 2024-06-20 2025-07-12 2026-08-03 Claude 3.5 Sonnet · 95.2 · 2024-06-20 o4-mini · 72 · 2025-04-17 GPT-5.2 Thinking · 88.7 · 2025-12-11 Inkling · 82 · 2026-07-17 Inkling-Small · 77.4 · 2026-08-03
Claude 3.5 Sonnet o4-mini GPT-5.2 Thinking Inkling Inkling-Small
Linha do tempo
Data Modelo Pontuação Fonte
2026-08-03 Inkling-Small 77.4% Thinking Machines Lab lança Inkling-Small, um modelo MoE multimodal de pesos abertos com 276B
2026-07-17 Inkling 82.0% Thinking Machines Lab lança Inkling, um modelo MoE multimodal de pesos abertos com 975B de parâmetros
2025-12-11 GPT-5.2 Thinking 88.7% OpenAI lança GPT-5.2, superando Gemini 3 em benchmarks de codificação e raciocínio
2025-04-17 o4-mini 72.0% OpenAI lança o4-mini, um modelo de raciocínio multimodal mais rápido e barato
2024-06-20 Claude 3.5 Sonnet 95.2% Anthropic lança adendo do Claude 3.5 Sonnet com benchmarks de codificação e visão aprimorados