Benchmark · multimodal

MathVista

5 resultados 5 modelos

O MathVista é um benchmark multimodal que mede o raciocínio matemático sobre entradas visuais: figuras, gráficos, diagramas geométricos e gráficos científicos. O desempenho é reportado como accuracy (acurácia): a proporção de perguntas respondidas corretamente.

Saiba mais
Exemplo
Um item típico combina uma imagem — um diagrama geométrico, o gráfico de uma função, um gráfico de barras ou uma tabela — com uma pergunta que só se resolve lendo detalhes visuais finos e depois raciocinando matematicamente, como calcular um comprimento a partir de uma figura rotulada ou ler um valor em um gráfico. Os itens são de múltipla escolha ou de resposta livre (inteiro, decimal ou lista).
Pontuação
A métrica é a accuracy (acurácia). Como as respostas são livres ou de múltipla escolha, primeiro um LLM extrai a resposta final curta da resposta completa do modelo; ela é normalizada e comparada com o gabarito por correspondência exata. A acurácia é a fração de itens corretos, também reportada detalhada por tipo de tarefa e tipo de raciocínio.
Verificação
A avaliação usa duas partições: um conjunto testmini de 1000 itens com respostas públicas para pontuar localmente, e um conjunto test maior, de cerca de 5141 itens, cujas respostas são ocultas e só pontuadas ao enviar as previsões para o placar de avaliação oficial. Um resultado conta como correto quando o processo de extração da resposta mais correspondência exata o aceita.
Por que importa
Benchmarks de matemática apenas textual e benchmarks genéricos de perguntas e respostas visuais deixam de fora, cada um a seu modo, a interseção que o MathVista mira: matemática impossível sem compreensão visual genuína. Ele revelou uma ampla lacuna entre modelos e humanos e se tornou uma régua padrão para o raciocínio matemático visual de modelos fundacionais multimodais.
Exemplo resolvido
Tarefa
Imagem: um triângulo retângulo com seus dois catetos rotulados 6 e 8. Pergunta: «Qual é o comprimento da hipotenusa na figura?». Tipo de resposta: inteiro de resposta livre.
Solução
Pelo teorema de Pitágoras, a hipotenusa c = √(6² + 8²) = √(36 + 64) = √100 = 10. Resposta final: 10.
Explicação
Resolvê-lo exige ler os comprimentos rotulados dos lados no diagrama (compreensão visual) e depois aplicar o teorema de Pitágoras (raciocínio matemático). Correção: um LLM extrai a resposta curta «10» da resposta do modelo, que é comparada ao gabarito por correspondência exata normalizada.
0 22.5 45 67.5 90 2024-06-20 2025-07-17 2026-08-13 Claude 3.5 Sonnet · 67.7 · 2024-06-20 Kimi k1.5 · 74.9 · 2025-01-22 o4-mini · 84.3 · 2025-04-17 Alita · 74 · 2025-05-26 LFM2.5-VL-3B · 68.5 · 2026-08-13
Claude 3.5 Sonnet Kimi k1.5 o4-mini Alita LFM2.5-VL-3B
Linha do tempo
Data Modelo Pontuação Fonte
2026-08-13 LFM2.5-VL-3B 68.5% Liquid AI lança LFM2.5-VL-3B, um modelo de visão e linguagem de 3B para dispositivos móveis com chamada de ferramentas
2025-05-26 Alita 74.0% Alita permite raciocínio agêntico escalável com mínima pré-definição e máxima autoevolução
2025-04-17 o4-mini 84.3% OpenAI lança o4-mini, um modelo de raciocínio multimodal mais rápido e barato
2025-01-22 Kimi k1.5 74.9% Kimi k1.5 escala aprendizado por reforço com LLMs para igualar o1 e superar modelos de CoT curto
2024-06-20 Claude 3.5 Sonnet 67.7% Anthropic lança adendo do Claude 3.5 Sonnet com benchmarks de codificação e visão aprimorados