Benchmark · general

MMLU

saturated 15 resultados 12 modelos

O MMLU (Massive Multitask Language Understanding) avalia a amplitude de conhecimento de um modelo em 57 áreas — de história e direito a matemática e medicina — por meio de questões de múltipla escolha. O resultado é dado como % de acerto: a proporção de questões respondidas corretamente.

Saiba mais
Exemplo
Um item típico traz uma pergunta e quatro alternativas rotuladas (A–D), e o modelo precisa escolher a correta — por exemplo, uma questão de medicina em nível universitário ou um problema de matemática básica.
Pontuação
A métrica é a acurácia (accuracy): o percentual de questões de múltipla escolha em que o modelo escolhe a alternativa correta, calculado como média entre as 57 áreas.
Verificação
A correção é automática e objetiva — a letra escolhida pelo modelo é comparada por correspondência exata (exact-match) com a resposta correta conhecida, sem necessidade de julgamento humano.
Por que importa
O MMLU virou uma régua padrão para medir amplitude de conhecimento e raciocínio, mas os melhores modelos já pontuam tão alto que ele está praticamente saturado e distingue menos os sistemas de ponta.
Exemplo resolvido
Tarefa
A seguir há uma questão de múltipla escolha sobre química do ensino médio. Qual das opções abaixo é um ácido forte? A) HF B) HCl C) CH3COOH D) H2CO3
Solução
O HCl se ioniza completamente em água, portanto é um ácido forte; HF, CH3COOH e H2CO3 se ionizam apenas parcialmente (ácidos fracos). Resposta final: B) HCl.
Explicação
Um ácido forte se dissocia totalmente em H+ e sua base conjugada em solução aquosa, o que o HCl faz e os demais não. O MMLU avalia por acurácia de correspondência exata: a letra da opção escolhida deve ser igual ao gabarito (B).
0 24 48 72 96 2023-03-14 2024-03-29 2025-04-15 Gemini Ultra · 90 · 2023-12-06 Gemini Ultra · 90 · 2023-12-06 Qwen2-72B · 84.2 · 2024-07-15 Qwen2-72B · 84.2 · 2024-07-15 Mistral Large 2 · 84 · 2024-07-24 Mistral Large 2 · 84 · 2024-07-25 Falcon3-10B-Base · 73.1 · 2024-12-17 Falcon3-7B-Base · 67.4 · 2024-12-17 Claude 3.7 Sonnet · 86.1 · 2025-02-24 GPT‑4.1 nano · 80.1 · 2025-04-14 Gemini 2.0 Flash · 83.4 · 2025-04-15 GPT-3.5 · 70 · 2023-03-14 GPT-4 · 86.4 · 2023-03-14 Claude 2 · 78.5 · 2023-07-11 Claude 3 Opus · 86.8 · 2024-03-04
Gemini Ultra Qwen2-72B Mistral Large 2 Falcon3-10B-Base Falcon3-7B-Base Claude 3.7 Sonnet GPT‑4.1 nano Gemini 2.0 Flash GPT-3.5 GPT-4 Claude 2 Claude 3 Opus
Linha do tempo
Data Modelo Pontuação Fonte
2025-04-15 Gemini 2.0 Flash 83.4% Google lança Gemini 2.0 Flash com qualidade aprimorada e o dobro da velocidade do Gemini 1.5 Pro
2025-04-14 GPT‑4.1 nano 80.1% OpenAI lança GPT-4.1, GPT-4.1 mini e GPT-4.1 nano na API
2025-02-24 Claude 3.7 Sonnet 86.1% Anthropic lança Claude 3.7 Sonnet com controle dinâmico de raciocínio
2024-12-17 Falcon3-10B-Base 73.1% Família Falcon3 lança cinco modelos abertos com capacidades aprimoradas de ciência, matemática e código
2024-12-17 Falcon3-7B-Base 67.4% Família Falcon3 lança cinco modelos abertos com capacidades aprimoradas de ciência, matemática e código
2024-07-25 Mistral Large 2 84.0% Mistral lança Mistral Large 2 com contexto de 128K e suporte multilíngue aprimorado
2024-07-24 Mistral Large 2 84.0% Mistral lança Large 2 com 123B de parâmetros para inferência em nó único com baixo custo
2024-07-15 Qwen2-72B 84.2% Equipe Qwen lança série Qwen2 com modelos densos e MoE de 72B
2024-07-15 Qwen2-72B 84.2% Relatório Técnico do Qwen2 apresenta modelos densos e MoE até 72B
2024-03-04 Claude 3 Opus 86.8% Anthropic
2023-12-06 Gemini Ultra 90.0% Google apresenta o Gemini 1.0, seu maior modelo de IA multimodal
2023-12-06 Gemini Ultra 90.0% Google
2023-07-11 Claude 2 78.5% Anthropic
2023-03-14 GPT-3.5 70.0% OpenAI
2023-03-14 GPT-4 86.4% OpenAI