Benchmark · reasoning

Humanity's Last Exam

32 resultados 24 modelos

Humanity's Last Exam (HLE) é um benchmark de questões de fronteira e nível especialista que abrangem muitos domínios acadêmicos (matemática, ciências, humanidades e mais), feito de propósito para ser extremamente difícil para a IA. Ele relata o desempenho como porcentagem de acertos (accuracy).

Saiba mais
Exemplo
Cada item é uma questão especialista de resposta fechada com uma única resposta correta; por exemplo, um problema avançado de matemática ou uma questão científica em nível de pós-graduação (algumas com uma imagem anexa), apresentada como múltipla escolha ou resposta curta exata.
Pontuação
A métrica é a acurácia (accuracy): a porcentagem de questões que o modelo responde corretamente. Algumas versões também relatam uma medida de calibração (confiança) ao lado da acurácia.
Verificação
Cada questão tem uma resposta correta conhecida, e a resposta do modelo é avaliada automaticamente em relação a essa referência (a opção correta na múltipla escolha, uma resposta curta correspondente) — avaliação automática e objetiva, não por voto humano.
Por que importa
Os benchmarks usuais ficaram saturados (os melhores modelos chegam perto do teto), então o HLE busca ser um teste difícil e discriminante na fronteira do conhecimento especialista humano — um indicador relevante de quão longe a IA está do raciocínio em nível de especialista.
Exemplo resolvido
Tarefa
Os beija-flores (ordem Apodiformes) possuem, de forma única, um osso sesamoide (sesamoid) oval e bilateralmente pareado, embutido na parte caudolateral da aponeurose (aponeurosis) cruciforme expandida de inserção do m. depressor caudae. Quantos tendões pareados esse osso sesamoide sustenta? Responda com um único número inteiro.
Solução
4
Explicação
O osso sesamoide oval se forma dentro da aponeurose cruciforme do músculo depressor da cauda e sustenta quatro tendões pareados dessa inserção — uma ossificação especializada exclusiva da anatomia caudal dos beija-flores. O HLE avalia a resposta pela correspondência exata do número inteiro enviado com a resposta de referência (4) e solicita separadamente uma confiança para calibração.
0 16 32 48 64 2025-01-23 2025-11-02 2026-08-13 the model powering deep research · 26.6 · 2025-02-02 Gemini 2.5 Pro (experimental) · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-26 Gemini 2.5 Pro · 18.8 · 2025-04-05 Grok 4 Heavy · 50.7 · 2025-07-09 GPT-5 Pro · 42 · 2025-08-07 Tongyi DeepResearch · 32.9 · 2025-09-16 DeepSeek-V3.2-Exp · 56.5 · 2025-09-29 Kimi K2 Thinking · 44.9 · 2025-11-07 MiroThinker v1.0 (72B variant) · 37.7 · 2025-11-14 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 48.4 · 2026-02-12 Kimi K2.5 · 51.8 · 2026-01-29 Claude Opus 4.6 · 53 · 2026-02-05 Claude Opus 4.6 · 40 · 2026-02-05 Claude Opus 4.6 · 53 · 2026-03-06 Claude Opus 4.7 · 46.9 · 2026-04-25 GPT-5.5 · 41.4 · 2026-04-25 Claude Fable 5 · 53 · 2026-06-09 Claude Opus 4.8 · 46 · 2026-07-01 Agents-A1 · 47.6 · 2026-07-06 PoTRE · 49.9 · 2026-07-23 Inkling-Small · 31.6 · 2026-08-03 DeepSeek-V4-Pro · 60 · 2026-08-13 DeepSeek R1 (text-only) · 9.4 · 2025-01-23 Grok 4 · 25.4 · 2025-07-09 GPT-5 · 24.8 · 2025-08-07
the model powering deep research Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Grok 4 Heavy GPT-5 Pro Tongyi DeepResearch DeepSeek-V3.2-Exp Kimi K2 Thinking MiroThinker v1.0 (72B variant) Gemini 3 Pro Gemini 3 Deep Think Kimi K2.5 Claude Opus 4.6 Claude Opus 4.7 GPT-5.5 Claude Fable 5 Claude Opus 4.8 Agents-A1 PoTRE Inkling-Small DeepSeek-V4-Pro DeepSeek R1 (text-only) Grok 4 GPT-5
Linha do tempo
Data Modelo Pontuação Fonte
2026-08-13 DeepSeek-V4-Pro 60.0% Lançamento GA do DeepSeek-V4-Pro melhora capacidades de agente e adiciona suporte à API de Respostas
2026-08-03 Inkling-Small 31.6% Thinking Machines Lab lança Inkling-Small, um modelo MoE multimodal de pesos abertos com 276B
2026-07-23 PoTRE 49.92% PoTRE apresenta estrutura multiagente heterogênea para raciocínio em tempo de teste
2026-07-06 Agents-A1 47.6pts Escalando o Horizonte, Não os Parâmetros: Alcançando Desempenho de Trilhões de Parâmetros com um Agente de 35B
2026-07-01 Claude Opus 4.8 46.0% Anthropic lança Claude Opus 4.8 com raciocínio adaptativo e honestidade aprimorada
2026-06-09 Claude Fable 5 53.0% Claude Fable 5 lança em #1 no Índice de Inteligência da Artificial Analysis
2026-04-25 Claude Opus 4.7 46.9% OpenAI lança GPT-5.5, um modelo retreinado do zero com processamento omnimodal nativo
2026-04-25 GPT-5.5 41.4% OpenAI lança GPT-5.5, um modelo retreinado do zero com processamento omnimodal nativo
2026-03-06 Claude Opus 4.6 53.0% Anthropic lança cartão do sistema Claude Opus 4.6 detalhando capacidades e avaliações de segurança
2026-02-12 Gemini 3 Deep Think 48.4% Google lança Gemini 3 Deep Think atualizado com novas pontuações de benchmarks
2026-02-05 Claude Opus 4.6 53.0% Anthropic publica o cartão do sistema do Claude Opus 4.6 detalhando capacidades e avaliações de segurança
2026-02-05 Claude Opus 4.6 40.0% Anthropic lança Claude Opus 4.6 com janela de contexto de 1M e melhorias agênticas
2026-01-29 Kimi K2.5 51.8% Moonshot lança o modelo agêntico multimodal Kimi K2.5
2025-11-18 Gemini 3 Pro 37.5% Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
2025-11-18 Gemini 3 Deep Think 41.0% Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
2025-11-18 Gemini 3 Pro 37.5% Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
2025-11-18 Gemini 3 Deep Think 41.0% Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
2025-11-14 MiroThinker v1.0 (72B variant) 37.7% MiroThinker v1.0 introduz escalonamento interativo para agentes de pesquisa de código aberto
2025-11-07 Kimi K2 Thinking 44.9% Moonshot AI lança Kimi K2 Thinking, um modelo de raciocínio open-source com 1T parâmetros
2025-09-29 DeepSeek-V3.2-Exp 56.53% DeepSeek lança DeepSeek-V3.2-Exp com Atenção Esparsa para eficiência em contextos longos
2025-09-16 Tongyi DeepResearch 32.9% Tongyi lança o DeepResearch, um agente web de código aberto que iguala o desempenho proprietário
2025-08-07 GPT-5 Pro 42.0% OpenAI lança GPT-5 unificado com roteamento em tempo real e acesso gratuito
2025-08-07 GPT-5 24.8% OpenAI
2025-07-09 Grok 4 Heavy 50.7% xAI lança Grok 4 com aprendizado por reforço em escala e uso nativo de ferramentas
2025-07-09 Grok 4 25.4% xAI
2025-04-05 Gemini 2.5 Pro 18.8% Google amplia acesso ao Gemini 2.5 Pro em meio a resultados sólidos de benchmark
2025-03-26 Gemini 2.5 Pro 18.8% Google lança modelo de raciocínio experimental Gemini 2.5 Pro com contexto de 1M tokens
2025-03-25 Gemini 2.5 Pro (experimental) 18.8% Google DeepMind lança modelo experimental Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 18.8% Google apresenta o modelo de raciocínio Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 18.8% Google apresenta o modelo experimental Gemini 2.5 Pro
2025-02-02 the model powering deep research 26.6% OpenAI lança pesquisa profunda no ChatGPT como uma capacidade agêntica
2025-01-23 DeepSeek R1 (text-only) 9.4% Humanity's Last Exam