Benchmark · multimodal

MMMU-Pro

11 resultados 8 modelos

O MMMU-Pro é uma versão reforçada em robustez do benchmark MMMU que mede a compreensão e o raciocínio multimodal (imagem + texto) em nível universitário em seis disciplinas; a métrica é a acurácia em questões de múltipla escolha.

Saiba mais
Exemplo
Uma questão de uma disciplina combina uma imagem — um diagrama, um gráfico, uma estrutura química ou um exame de imagem médico — com uma pergunta de nível universitário e até 10 alternativas de resposta; no modo somente visão, toda a questão e suas alternativas ficam embutidas dentro de uma captura de tela ou foto, de modo que o modelo precisa ler o texto a partir da própria imagem.
Pontuação
Acurácia: a alternativa escolhida pelo modelo é comparada por correspondência exata com o gabarito de referência, e a pontuação é a porcentagem de itens respondidos corretamente. As alternativas candidatas são ampliadas de 4 para 10 para reduzir o acerto por chute, e a pontuação geral do MMMU-Pro é a média dos modos Standard (10 alternativas) e Vision (entrada por imagem) (normalmente se usa raciocínio em cadeia, Chain-of-Thought).
Verificação
Cada item é de múltipla escolha com uma única resposta correta, então a correção é automática: a alternativa final escolhida é extraída da saída do modelo (muitas vezes com cadeia de raciocínio) e comparada por correspondência exata com a resposta de referência. A robustez está embutida nos dados — questões que modelos somente de texto conseguem responder são filtradas e o número de alternativas é elevado para 10 — de modo que uma pontuação alta reflete raciocínio multimodal genuíno, e não atalhos textuais ou acertos por sorte.
Por que importa
O MMMU original inflava as pontuações porque os modelos podiam explorar atalhos somente de texto ou chutar entre quatro alternativas; o MMMU-Pro elimina ambos, então a acurácia medida cai fortemente e separa melhor os modelos que de fato integram visão e texto, tornando-se uma medida mais honesta da capacidade multimodal de nível especialista.
Exemplo resolvido
Tarefa
Item representativo de Ciência (Física) no formato MMMU-Pro. [Imagem: um bloco sobre um plano inclinado sem atrito com ângulo θ = 30°.] Pergunta: qual é o módulo da aceleração do bloco ao longo do plano inclinado? Alternativas (10): (A) 0 m/s² (B) 1.6 m/s² (C) 2.5 m/s² (D) 3.3 m/s² (E) 4.9 m/s² (F) 5.7 m/s² (G) 6.9 m/s² (H) 7.4 m/s² (I) 8.5 m/s² (J) 9.8 m/s². No modo somente visão, todo esse enunciado aparece embutido dentro de uma captura de tela.
Solução
a = g·sin θ = 9.8 × sin 30° = 9.8 × 0.5 = 4.9 m/s² → (E)
Explicação
Em um plano inclinado sem atrito, a única força que age ao longo da superfície é a componente da gravidade mg·sin θ, então a aceleração é g·sin θ e independe da massa do bloco; g·sin 30° = 4.9 m/s², o que corresponde à alternativa (E). A correção compara por correspondência exata a letra da alternativa extraída com o gabarito de referência.
0 22.5 45 67.5 90 2023-12-06 2025-04-04 2026-08-03 Gemini Ultra · 59.4 · 2023-12-06 Claude 3.5 Sonnet · 68.3 · 2024-06-20 o1 · 78.2 · 2024-09-12 Gemini 2.5 Pro Deep Think · 84 · 2025-05-20 Gemini 3 Pro · 81 · 2025-11-18 Gemini 3 Pro · 81 · 2025-11-18 Claude Opus 4.6 · 73.9 · 2026-02-05 Claude Opus 4.6 · 70.6 · 2026-02-05 Claude Opus 4.6 · 70.6 · 2026-03-06 Kimi K3 · 81.6 · 2026-07-17 Inkling-Small · 74 · 2026-08-03
Gemini Ultra Claude 3.5 Sonnet o1 Gemini 2.5 Pro Deep Think Gemini 3 Pro Claude Opus 4.6 Kimi K3 Inkling-Small
Linha do tempo
Data Modelo Pontuação Fonte
2026-08-03 Inkling-Small 74.0% Thinking Machines Lab lança Inkling-Small, um modelo MoE multimodal de pesos abertos com 276B
2026-07-17 Kimi K3 81.6% Moonshot AI lança o Kimi K3 aberto, um modelo MoE de 2,8T parâmetros com contexto de 1M
2026-03-06 Claude Opus 4.6 70.6% Anthropic lança cartão do sistema Claude Opus 4.6 detalhando capacidades e avaliações de segurança
2026-02-05 Claude Opus 4.6 73.9% Anthropic lança Claude Opus 4.6 com janela de contexto de 1M e melhorias agênticas
2026-02-05 Claude Opus 4.6 70.6% Anthropic publica o cartão do sistema do Claude Opus 4.6 detalhando capacidades e avaliações de segurança
2025-11-18 Gemini 3 Pro 81.0% Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
2025-11-18 Gemini 3 Pro 81.0% Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
2025-05-20 Gemini 2.5 Pro Deep Think 84.0% Google DeepMind atualiza o Gemini 2.5 com Deep Think, saída de áudio e uso do computador
2024-09-12 o1 78.2% OpenAI lança o1-preview, um modelo de raciocínio que supera especialistas humanos em benchmarks de matemática e ciências
2024-06-20 Claude 3.5 Sonnet 68.3% Anthropic lança adendo do Claude 3.5 Sonnet com benchmarks de codificação e visão aprimorados
2023-12-06 Gemini Ultra 59.4% Google apresenta o Gemini 1.0, seu maior modelo de IA multimodal