Benchmark · general

MMLU-Pro

11 resultados 10 modelos

MMLU-Pro é um sucessor mais difícil e voltado ao raciocínio do MMLU que avalia o conhecimento e a resolução de problemas de um modelo em muitas disciplinas acadêmicas por meio de questões de múltipla escolha, cada uma com 10 opções de resposta. O resultado é dado como porcentagem de acerto — a proporção de questões respondidas corretamente.

Saiba mais
Exemplo
Um item típico é uma questão de múltipla escolha de uma área como matemática, física, direito ou engenharia que exige vários passos de raciocínio, na qual o modelo deve escolher a única resposta correta entre 10 opções (contra 4 no MMLU original).
Pontuação
A métrica é a acurácia (accuracy): a porcentagem de questões em que o modelo escolhe a opção correta, calculada como respostas corretas dividido pelo total de questões.
Verificação
Cada resposta é avaliada automaticamente por correspondência exata entre a opção escolhida pelo modelo e o rótulo correto conhecido, sem necessidade de julgamento humano.
Por que importa
Como os principais modelos quase haviam saturado o MMLU original, as questões mais difíceis e as 10 opções do MMLU-Pro o tornam mais discriminativo e mais sensível ao raciocínio real, oferecendo uma medida mais limpa do progresso.
Exemplo resolvido
Tarefa
MMLU-Pro (física, 10 opções). Um projétil é lançado do nível do solo a 20 m/s, a 30° acima da horizontal (g = 10 m/s², sem resistência do ar). Qual é a sua altura máxima? A) 2.5 m B) 5.0 m C) 7.5 m D) 10.0 m E) 12.5 m F) 15.0 m G) 17.3 m H) 20.0 m I) 3.5 m J) 8.7 m
Solução
v_y = v·sin30° = 20 × 0.5 = 10 m/s; h_max = v_y² / (2g) = 10² / (2 × 10) = 5.0 m → B
Explicação
No ponto mais alto a velocidade vertical é zero, então h_max = v_y²/(2g) com v_y = v·sin30°; apenas a componente vertical define a altura. O MMLU-Pro pontua por correspondência exata da letra escolhida com o gabarito (accuracy sobre suas 10 opções).
0 24 48 72 96 2024-06-03 2024-12-30 2025-07-28 GPT-4o · 72.6 · 2024-06-03 GPT-4o · 72.6 · 2024-06-03 GPT-4-Turbo · 63.7 · 2024-06-03 Claude 3.5 Sonnet · 90.4 · 2024-06-20 Falcon3-3B-Instruct · 29.7 · 2024-12-17 Falcon3-7B-Base · 39.2 · 2024-12-17 Falcon3-10B-Base · 42.5 · 2024-12-17 DeepSeek-V3-0324 · 81.2 · 2025-03-24 Gemini 2.0 Flash · 77.6 · 2025-04-15 Deepseek-R1-0528 · 85 · 2025-05-30 GLM-4.5 · 84.6 · 2025-07-28
GPT-4o GPT-4-Turbo Claude 3.5 Sonnet Falcon3-3B-Instruct Falcon3-7B-Base Falcon3-10B-Base DeepSeek-V3-0324 Gemini 2.0 Flash Deepseek-R1-0528 GLM-4.5
Linha do tempo
Data Modelo Pontuação Fonte
2025-07-28 GLM-4.5 84.6% Zhipu AI lança os modelos base GLM-4.5 e GLM-4.5-Air para agentes inteligentes
2025-05-30 Deepseek-R1-0528 85.0% DeepSeek atualiza modelo R1 com raciocínio aprimorado e melhores pontuações em benchmarks
2025-04-15 Gemini 2.0 Flash 77.6% Google lança Gemini 2.0 Flash com qualidade aprimorada e o dobro da velocidade do Gemini 1.5 Pro
2025-03-24 DeepSeek-V3-0324 81.2% DeepSeek-V3-0324 melhora raciocínio, programação e escrita em chinês em relação ao DeepSeek-V3
2024-12-17 Falcon3-3B-Instruct 29.7% Família Falcon3 lança cinco modelos abertos com capacidades aprimoradas de ciência, matemática e código
2024-12-17 Falcon3-7B-Base 39.2% Família Falcon3 lança cinco modelos abertos com capacidades aprimoradas de ciência, matemática e código
2024-12-17 Falcon3-10B-Base 42.5% Família Falcon3 lança cinco modelos abertos com capacidades aprimoradas de ciência, matemática e código
2024-06-20 Claude 3.5 Sonnet 90.4% Anthropic lança adendo do Claude 3.5 Sonnet com benchmarks de codificação e visão aprimorados
2024-06-03 GPT-4o 72.6% MMLU-Pro apresenta um benchmark mais robusto com 10 opções e perguntas focadas em raciocínio
2024-06-03 GPT-4-Turbo 63.7% MMLU-Pro apresenta um benchmark mais robusto com 10 opções e perguntas focadas em raciocínio
2024-06-03 GPT-4o 72.6% MMLU-Pro paper