Benchmark · reasoning

GPQA Diamond

61 resultados 44 modelos

GPQA Diamond é o subconjunto mais difícil do GPQA, um conjunto de questões de múltipla escolha de nível de pós-graduação e "à prova de Google" sobre biologia, física e química escritas por especialistas. O modelo é avaliado pela porcentagem de acerto ao escolher a resposta correta.

Saiba mais
Exemplo
Um item típico é uma questão difícil de múltipla escolha que exige raciocínio de nível de pós-graduação; por exemplo, uma questão de química que descreve um mecanismo de reação e pergunta qual das quatro opções gera o produto correto, tão difícil que um leigo não resolve nem com buscas na web.
Pontuação
A pontuação é a porcentagem de questões respondidas corretamente (acurácia): o número de itens em que o modelo escolhe a opção certa dividido pelo total de questões.
Verificação
Cada resposta é avaliada automaticamente por correspondência exata com a única opção correta conhecida, sem necessidade de julgamento humano; o próprio rótulo "Diamond" foi atribuído na criação do conjunto de dados, quando especialistas qualificados concordavam com a resposta e os não especialistas ainda erravam.
Por que importa
É um dos testes mais rigorosos de raciocínio científico genuíno de nível especialista (e não de fatos que se pode pesquisar), por isso uma boa pontuação no GPQA Diamond é um sinal de destaque de que um modelo de fronteira consegue raciocinar sobre problemas difíceis e especializados.
Exemplo resolvido
Tarefa
Um elétron está no estado de spin (não normalizado) (3i, 4)ᵀ. Encontre o valor esperado do seu spin ao longo do eixo y, S_y. Opções: (A) 12ħ/25 (B) −12ħ/25 (C) 25ħ/2 (D) −25ħ/2.
Solução
Norm: |3i|²+|4|²=25. σ_y=[[0,−i],[i,0]]. ⟨S_y⟩=(ħ/2)·(ψ†σ_yψ)/(ψ†ψ)=(ħ/2)·(−24/25)=−12ħ/25 → (B).
Explicação
Usando ⟨S_y⟩ = ψ†S_yψ / ψ†ψ com S_y = (ħ/2)σ_y, o numerador ψ†σ_yψ = −24 e a norma ψ†ψ = 25, resultando em −12ħ/25 (opção B). O GPQA avalia pela correspondência exata da letra escolhida com o gabarito.
0 25 50 75 100 2023-11-20 2025-03-27 2026-08-03 GPT-4 based baseline · 39 · 2023-11-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 65 · 2025-02-26 Qwen2-72B · 37.9 · 2024-07-15 Qwen2-72B · 37.9 · 2024-07-15 QwQ-32B-Preview · 65.2 · 2024-11-28 o3 · 87.7 · 2024-12-20 o3 · 87.7 · 2026-03-25 Grok 3 (Think) · 84.6 · 2025-02-19 Claude 3.7 Sonnet · 84.8 · 2025-02-24 Claude 3.7 Sonnet · 84.8 · 2025-02-26 Grok 3 Beta · 84.6 · 2025-02-26 DeepSeek R1 · 71.5 · 2025-02-26 OpenAI o3-mini · 78 · 2025-02-26 GPT-4.5 · 71.4 · 2025-03-05 Grok 3 · 84.6 · 2025-03-11 DeepSeek-V3-0324 · 68.4 · 2025-03-24 Gemini 2.5 Pro (experimental) · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-26 Gemini 2.5 Pro · 84 · 2025-04-05 Seed1.5-Thinking · 77.3 · 2025-04-10 GPT‑4.1 nano · 50.3 · 2025-04-14 Gemini 2.0 Flash · 60.1 · 2025-04-15 Claude Sonnet 4 · 70 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Deepseek-R1-0528 · 81 · 2025-05-30 Kimi K2 · 75.1 · 2025-07-28 Kimi K2 · 75.1 · 2025-07-28 GPT-5 pro · 88.4 · 2025-08-07 GPT-5 pro · 89.4 · 2025-08-07 GPT-5 Pro · 88.4 · 2025-08-07 DeepSeek-V3.1-Terminus · 74.2 · 2025-09-22 Claude Sonnet 4.5 · 83.4 · 2025-09-30 GPT-5.2 · 92.4 · 2025-10-24 GPT-4 · 39 · 2025-10-24 Claude 3 Opus · 60 · 2025-10-24 O1 · 77 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2026-02-05 Gemini 3 Pro · 91.9 · 2025-10-24 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 93 · 2025-12-04 Gemini 3.1 Pro Preview · 94.1 · 2025-10-24 Aristotle-X1 · 92.4 · 2025-10-24 Gemini 3 Deep Think · 93.8 · 2025-11-18 Gemini 3 Deep Think · 93.8 · 2025-11-18 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 Kimi K2.5 · 87.6 · 2026-01-27 Grok 4 · 87.7 · 2026-02-25 GPT-Live-1 · 84.2 · 2026-07-17 Kimi K3 · 93.5 · 2026-07-17 Inkling-Small · 89.5 · 2026-08-03 Qwen3.8-Max · 92.6 · 2026-08-03 OpenAI o3 · 87.7 · 2025-04-16
GPT-4 based baseline Claude 3.5 Sonnet Qwen2-72B QwQ-32B-Preview o3 Grok 3 (Think) Claude 3.7 Sonnet Grok 3 Beta DeepSeek R1 OpenAI o3-mini GPT-4.5 Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Seed1.5-Thinking GPT‑4.1 nano Gemini 2.0 Flash Claude Sonnet 4 Claude Opus 4 Deepseek-R1-0528 Kimi K2 GPT-5 pro GPT-5 Pro DeepSeek-V3.1-Terminus Claude Sonnet 4.5 GPT-5.2 GPT-4 Claude 3 Opus O1 Claude Opus 4.6 Gemini 3 Pro Gemini 3.1 Pro Preview Aristotle-X1 Gemini 3 Deep Think GPT-5.2 Thinking GPT-5.2 Pro Kimi K2.5 Grok 4 GPT-Live-1 Kimi K3 Inkling-Small Qwen3.8-Max OpenAI o3
Linha do tempo
Data Modelo Pontuação Fonte
2026-08-03 Qwen3.8-Max 92.6% Alibaba lança Qwen3.8-Max, um modelo MoE de 2,4T parâmetros
2026-08-03 Inkling-Small 89.5% Thinking Machines Lab lança Inkling-Small, um modelo MoE multimodal de pesos abertos com 276B
2026-07-17 Kimi K3 93.5% Moonshot AI lança o Kimi K3 aberto, um modelo MoE de 2,8T parâmetros com contexto de 1M
2026-07-17 GPT-Live-1 84.2% OpenAI lança modelos de voz full-duplex e tribunal alemão responsabiliza o Google por Visões Gerais da IA
2026-03-25 o3 87.7% OpenAI anuncia a aposentadoria do o3 do ChatGPT e compartilha pontuações de benchmarks
2026-02-25 Grok 4 87.7% xAI lança modelo de raciocínio Grok 4 com fortes benchmarks agênticos e de codificação
2026-02-05 Claude Opus 4.6 91.3% Anthropic lança Claude Opus 4.6 com janela de contexto de 1M e melhorias agênticas
2026-01-27 Kimi K2.5 87.6% Moonshot lança Kimi K2.5 com tecnologia Agent Swarm
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI apresenta GPT-5.2 com capacidades aprimoradas de codificação, contexto longo e raciocínio
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI lança modelos GPT-5.2 Pro e Thinking para ciência e matemática
2025-12-11 GPT-5.2 Pro 93.2% OpenAI lança modelos GPT-5.2 Pro e Thinking para ciência e matemática
2025-12-11 GPT-5.2 Pro 93.2% OpenAI apresenta GPT-5.2 com capacidades aprimoradas de codificação, contexto longo e raciocínio
2025-12-04 Gemini 3 Pro 93.0% Epoch AI lança o Hub de Data Centers de Fronteira e analisa benchmark OSWorld
2025-11-18 Gemini 3 Pro 91.9% Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
2025-11-18 Gemini 3 Deep Think 93.8% Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
2025-11-18 Gemini 3 Pro 91.9% Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
2025-11-18 Gemini 3 Deep Think 93.8% Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
2025-10-24 GPT-5.2 92.4% Benchmark GPQA-Diamond: Pontuações, Ranking e Como os Modelos de IA se Comparam
2025-10-24 GPT-4 39.0% Benchmark GPQA-Diamond: Pontuações, Ranking e Como os Modelos de IA se Comparam
2025-10-24 Claude 3 Opus 60.0% Benchmark GPQA-Diamond: Pontuações, Ranking e Como os Modelos de IA se Comparam
2025-10-24 O1 77.0% Benchmark GPQA-Diamond: Pontuações, Ranking e Como os Modelos de IA se Comparam
2025-10-24 Claude Opus 4.6 91.3% Benchmark GPQA-Diamond: Pontuações, Ranking e Como os Modelos de IA se Comparam
2025-10-24 Gemini 3 Pro 91.9% Benchmark GPQA-Diamond: Pontuações, Ranking e Como os Modelos de IA se Comparam
2025-10-24 Gemini 3.1 Pro Preview 94.1% Benchmark GPQA-Diamond: Pontuações, Ranking e Como os Modelos de IA se Comparam
2025-10-24 Aristotle-X1 92.4% Benchmark GPQA-Diamond: Pontuações, Ranking e Como os Modelos de IA se Comparam
2025-09-30 Claude Sonnet 4.5 83.4% Anthropic lança Claude Sonnet 4.5 com capacidades aprimoradas de codificação e agentes
2025-09-22 DeepSeek-V3.1-Terminus 74.24% DeepSeek lança DeepSeek-V3.1-Terminus com correções de idioma e agentes
2025-08-07 GPT-5 pro 88.4% OpenAI apresenta GPT-5 com roteamento unificado e raciocínio de nível especialista
2025-08-07 GPT-5 Pro 88.4% OpenAI lança GPT-5 com raciocínio adaptativo e arquitetura unificada
2025-08-07 GPT-5 pro 89.4% OpenAI lança GPT-5 unificado com roteamento em tempo real e acesso gratuito
2025-07-28 Kimi K2 75.1% Kimi K2: modelo MoE aberto com 1T de parâmetros e otimizador MuonClip
2025-07-28 Kimi K2 75.1% Moonshot lança Kimi K2, um modelo MoE agêntico aberto com 32B de parâmetros ativados
2025-05-30 Deepseek-R1-0528 81.0% DeepSeek atualiza modelo R1 com raciocínio aprimorado e melhores pontuações em benchmarks
2025-05-22 Claude Sonnet 4 70.0% Anthropic apresenta Claude Opus 4 e Sonnet 4 com pensamento estendido e uso de ferramentas
2025-05-22 Claude Opus 4 74.9% Anthropic lança Claude Opus 4 e Sonnet 4 com medidas de segurança ASL-3
2025-05-22 Claude Opus 4 74.9% Anthropic apresenta Claude Opus 4 e Sonnet 4 com pensamento estendido e uso de ferramentas
2025-04-16 OpenAI o3 87.7% OpenAI
2025-04-15 Gemini 2.0 Flash 60.1% Google lança Gemini 2.0 Flash com qualidade aprimorada e o dobro da velocidade do Gemini 1.5 Pro
2025-04-14 GPT‑4.1 nano 50.3% OpenAI lança GPT-4.1, GPT-4.1 mini e GPT-4.1 nano na API
2025-04-10 Seed1.5-Thinking 77.3% Seed1.5-Thinking usa aprendizado por reforço para melhorar o raciocínio
2025-04-05 Gemini 2.5 Pro 84.0% Google amplia acesso ao Gemini 2.5 Pro em meio a resultados sólidos de benchmark
2025-03-26 Gemini 2.5 Pro 84.0% Google lança modelo de raciocínio experimental Gemini 2.5 Pro com contexto de 1M tokens
2025-03-25 Gemini 2.5 Pro (experimental) 84.0% Google DeepMind lança modelo experimental Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 84.0% Google DeepMind
2025-03-24 DeepSeek-V3-0324 68.4% DeepSeek-V3-0324 melhora raciocínio, programação e escrita em chinês em relação ao DeepSeek-V3
2025-03-11 Grok 3 84.6% xAI lança Grok 3 com raciocínio profundo e contexto de milhão de tokens
2025-03-05 GPT-4.5 71.4% OpenAI lança GPT-4.5, seu maior modelo, para o ChatGPT Plus
2025-02-26 Claude 3.7 Sonnet 84.8% Comparação de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 e Grok 3 Beta
2025-02-26 Grok 3 Beta 84.6% Comparação de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 e Grok 3 Beta
2025-02-26 DeepSeek R1 71.5% Comparação de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 e Grok 3 Beta
2025-02-26 OpenAI o3-mini 78.0% Comparação de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 e Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 65.0% Comparação de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 e Grok 3 Beta
2025-02-24 Claude 3.7 Sonnet 84.8% Anthropic lança Claude 3.7 Sonnet com controle dinâmico de raciocínio
2025-02-19 Grok 3 (Think) 84.6% xAI lança Grok 3 Beta e agente DeepSearch
2024-12-20 o3 87.7% OpenAI lança modelo o3 com alto desempenho em raciocínio e programação
2024-11-28 QwQ-32B-Preview 65.2% Qwen lança QwQ-32B-Preview, um modelo de raciocínio experimental
2024-07-15 Qwen2-72B 37.9% Equipe Qwen lança série Qwen2 com modelos densos e MoE de 72B
2024-07-15 Qwen2-72B 37.9% Relatório Técnico do Qwen2 apresenta modelos densos e MoE até 72B
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic lança adendo do Claude 3.5 Sonnet com benchmarks de codificação e visão aprimorados
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic
2023-11-20 GPT-4 based baseline 39.0% GPQA: Um benchmark de perguntas e respostas de nível de pós-graduação à prova do Google