Benchmark · multimodal

MMMU

8 resultados 7 modelos

O MMMU (Massive Multi-discipline Multimodal Understanding) avalia se um modelo consegue responder perguntas de nível universitário que combinam imagens e texto em muitas disciplinas acadêmicas. O resultado é informado como porcentagem de acertos (acurácia).

Saiba mais
Exemplo
Uma pergunta pode mostrar um diagrama de química, um gráfico ou uma imagem médica junto com texto e pedir que o modelo raciocine e escolha a resposta correta, como um item de prova universitária.
Pontuação
Cada pergunta é marcada como certa ou errada, e a pontuação é a porcentagem de perguntas respondidas corretamente (acurácia).
Verificação
As respostas são verificadas automaticamente por correspondência exata com a resposta de referência (em geral múltipla escolha, algumas respostas abertas curtas), sem necessidade de avaliação humana.
Por que importa
Ele mede o raciocínio especializado de nível universitário sobre imagens e texto em dezenas de matérias, sendo um teste exigente de compreensão multimodal real, e não apenas de habilidade com texto.
Exemplo resolvido
Tarefa
(Imagem: um diagrama de circuito — uma bateria de 12 V em uma única malha com dois resistores em série, R1 = 4 Ω e R2 = 8 Ω.) Qual é a corrente que passa pelo resistor R2? Opções: (A) 1.0 A (B) 1.5 A (C) 2.0 A (D) 3.0 A.
Solução
R_total = R1 + R2 = 4 Ω + 8 Ω = 12 Ω; I = V / R_total = 12 V / 12 Ω = 1.0 A (series ⇒ same current in R2). Answer: (A).
Explicação
Em um circuito em série, a mesma corrente flui por todos os elementos e a resistência total é a soma das partes, então I = 12/12 = 1.0 A. O MMMU avalia por correspondência exata entre a letra da opção prevista e a única resposta correta.
0 22.5 45 67.5 90 2023-11-27 2024-10-01 2025-08-07 Gemini 2.5 Pro · 81.7 · 2025-03-26 Gemini 2.0 Flash · 71.7 · 2025-04-15 o4-mini · 81.6 · 2025-04-17 GPT-5 · 84.2 · 2025-08-07 GPT-5 · 84.2 · 2025-08-07 GPT-4V · 56.8 · 2023-11-27 Claude 3 Opus · 59.4 · 2024-03-04 GPT-4o · 69.1 · 2024-05-13
Gemini 2.5 Pro Gemini 2.0 Flash o4-mini GPT-5 GPT-4V Claude 3 Opus GPT-4o
Linha do tempo
Data Modelo Pontuação Fonte
2025-08-07 GPT-5 84.2% OpenAI apresenta GPT-5 com roteamento unificado e raciocínio de nível especialista
2025-08-07 GPT-5 84.2% OpenAI lança GPT-5 com raciocínio adaptativo e arquitetura unificada
2025-04-17 o4-mini 81.6% OpenAI lança o4-mini, um modelo de raciocínio multimodal mais rápido e barato
2025-04-15 Gemini 2.0 Flash 71.7% Google lança Gemini 2.0 Flash com qualidade aprimorada e o dobro da velocidade do Gemini 1.5 Pro
2025-03-26 Gemini 2.5 Pro 81.7% Google lança modelo de raciocínio experimental Gemini 2.5 Pro com contexto de 1M tokens
2024-05-13 GPT-4o 69.1% OpenAI
2024-03-04 Claude 3 Opus 59.4% Anthropic
2023-11-27 GPT-4V 56.8% MMMU paper