Benchmark · multimodal
MMMU
O MMMU (Massive Multi-discipline Multimodal Understanding) avalia se um modelo consegue responder perguntas de nível universitário que combinam imagens e texto em muitas disciplinas acadêmicas. O resultado é informado como porcentagem de acertos (acurácia).
Saiba mais
- Exemplo
- Uma pergunta pode mostrar um diagrama de química, um gráfico ou uma imagem médica junto com texto e pedir que o modelo raciocine e escolha a resposta correta, como um item de prova universitária.
- Pontuação
- Cada pergunta é marcada como certa ou errada, e a pontuação é a porcentagem de perguntas respondidas corretamente (acurácia).
- Verificação
- As respostas são verificadas automaticamente por correspondência exata com a resposta de referência (em geral múltipla escolha, algumas respostas abertas curtas), sem necessidade de avaliação humana.
- Por que importa
- Ele mede o raciocínio especializado de nível universitário sobre imagens e texto em dezenas de matérias, sendo um teste exigente de compreensão multimodal real, e não apenas de habilidade com texto.
Exemplo resolvido
Tarefa
(Imagem: um diagrama de circuito — uma bateria de 12 V em uma única malha com dois resistores em série, R1 = 4 Ω e R2 = 8 Ω.) Qual é a corrente que passa pelo resistor R2? Opções: (A) 1.0 A (B) 1.5 A (C) 2.0 A (D) 3.0 A.
Solução
R_total = R1 + R2 = 4 Ω + 8 Ω = 12 Ω; I = V / R_total = 12 V / 12 Ω = 1.0 A (series ⇒ same current in R2). Answer: (A).
Explicação
Em um circuito em série, a mesma corrente flui por todos os elementos e a resistência total é a soma das partes, então I = 12/12 = 1.0 A. O MMMU avalia por correspondência exata entre a letra da opção prevista e a única resposta correta.
| Data | Modelo | Pontuação | Fonte |
|---|---|---|---|
| 2025-08-07 | GPT-5 | 84.2% | OpenAI apresenta GPT-5 com roteamento unificado e raciocínio de nível especialista |
| 2025-08-07 | GPT-5 | 84.2% | OpenAI lança GPT-5 com raciocínio adaptativo e arquitetura unificada |
| 2025-04-17 | o4-mini | 81.6% | OpenAI lança o4-mini, um modelo de raciocínio multimodal mais rápido e barato |
| 2025-04-15 | Gemini 2.0 Flash | 71.7% | Google lança Gemini 2.0 Flash com qualidade aprimorada e o dobro da velocidade do Gemini 1.5 Pro |
| 2025-03-26 | Gemini 2.5 Pro | 81.7% | Google lança modelo de raciocínio experimental Gemini 2.5 Pro com contexto de 1M tokens |
| 2024-05-13 | GPT-4o | 69.1% | OpenAI |
| 2024-03-04 | Claude 3 Opus | 59.4% | Anthropic |
| 2023-11-27 | GPT-4V | 56.8% | MMMU paper |