Benchmark · reasoning

GPQA Diamond

61 résultats 44 modèles

GPQA Diamond est le sous-ensemble le plus difficile de GPQA, un ensemble de questions à choix multiples de niveau master/doctorat et « à l'épreuve de Google » en biologie, physique et chimie rédigées par des experts. Le modèle est évalué par son pourcentage de bonnes réponses.

En savoir plus
Exemple
Un item typique est une question à choix multiples difficile exigeant un raisonnement de niveau doctoral ; par exemple, une question de chimie décrivant un mécanisme réactionnel et demandant laquelle des quatre options donne le bon produit, si ardue qu'un non-expert ne la résout même pas avec une recherche sur le web.
Notation
Le score est le pourcentage de questions répondues correctement (exactitude) : le nombre d'items où le modèle choisit la bonne option divisé par le nombre total de questions.
Vérification
Chaque réponse est notée automatiquement par correspondance exacte avec l'unique bonne option connue, sans jugement humain ; l'étiquette « Diamond » elle-même a été attribuée lors de la création du jeu de données, lorsque des experts qualifiés s'accordaient sur la réponse et que les non-experts se trompaient malgré tout.
Pourquoi c'est important
C'est l'un des tests les plus exigeants du véritable raisonnement scientifique de niveau expert (et non de faits que l'on peut chercher), si bien qu'un score élevé à GPQA Diamond est un signal marquant qu'un modèle de pointe sait raisonner sur des problèmes difficiles et spécialisés.
Exemple résolu
Tâche
Un électron est dans l'état de spin (non normalisé) (3i, 4)ᵀ. Trouvez la valeur moyenne de son spin selon l'axe y, S_y. Options : (A) 12ħ/25 (B) −12ħ/25 (C) 25ħ/2 (D) −25ħ/2.
Solution
Norm: |3i|²+|4|²=25. σ_y=[[0,−i],[i,0]]. ⟨S_y⟩=(ħ/2)·(ψ†σ_yψ)/(ψ†ψ)=(ħ/2)·(−24/25)=−12ħ/25 → (B).
Explication
Avec ⟨S_y⟩ = ψ†S_yψ / ψ†ψ et S_y = (ħ/2)σ_y, le numérateur ψ†σ_yψ = −24 et la norme ψ†ψ = 25, ce qui donne −12ħ/25 (option B). GPQA évalue par correspondance exacte de la lettre choisie avec la clé de correction.
0 25 50 75 100 2023-11-20 2025-03-27 2026-08-03 GPT-4 based baseline · 39 · 2023-11-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 65 · 2025-02-26 Qwen2-72B · 37.9 · 2024-07-15 Qwen2-72B · 37.9 · 2024-07-15 QwQ-32B-Preview · 65.2 · 2024-11-28 o3 · 87.7 · 2024-12-20 o3 · 87.7 · 2026-03-25 Grok 3 (Think) · 84.6 · 2025-02-19 Claude 3.7 Sonnet · 84.8 · 2025-02-24 Claude 3.7 Sonnet · 84.8 · 2025-02-26 Grok 3 Beta · 84.6 · 2025-02-26 DeepSeek R1 · 71.5 · 2025-02-26 OpenAI o3-mini · 78 · 2025-02-26 GPT-4.5 · 71.4 · 2025-03-05 Grok 3 · 84.6 · 2025-03-11 DeepSeek-V3-0324 · 68.4 · 2025-03-24 Gemini 2.5 Pro (experimental) · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-26 Gemini 2.5 Pro · 84 · 2025-04-05 Seed1.5-Thinking · 77.3 · 2025-04-10 GPT‑4.1 nano · 50.3 · 2025-04-14 Gemini 2.0 Flash · 60.1 · 2025-04-15 Claude Sonnet 4 · 70 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Deepseek-R1-0528 · 81 · 2025-05-30 Kimi K2 · 75.1 · 2025-07-28 Kimi K2 · 75.1 · 2025-07-28 GPT-5 pro · 88.4 · 2025-08-07 GPT-5 pro · 89.4 · 2025-08-07 GPT-5 Pro · 88.4 · 2025-08-07 DeepSeek-V3.1-Terminus · 74.2 · 2025-09-22 Claude Sonnet 4.5 · 83.4 · 2025-09-30 GPT-5.2 · 92.4 · 2025-10-24 GPT-4 · 39 · 2025-10-24 Claude 3 Opus · 60 · 2025-10-24 O1 · 77 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2026-02-05 Gemini 3 Pro · 91.9 · 2025-10-24 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 93 · 2025-12-04 Gemini 3.1 Pro Preview · 94.1 · 2025-10-24 Aristotle-X1 · 92.4 · 2025-10-24 Gemini 3 Deep Think · 93.8 · 2025-11-18 Gemini 3 Deep Think · 93.8 · 2025-11-18 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 Kimi K2.5 · 87.6 · 2026-01-27 Grok 4 · 87.7 · 2026-02-25 GPT-Live-1 · 84.2 · 2026-07-17 Kimi K3 · 93.5 · 2026-07-17 Inkling-Small · 89.5 · 2026-08-03 Qwen3.8-Max · 92.6 · 2026-08-03 OpenAI o3 · 87.7 · 2025-04-16
GPT-4 based baseline Claude 3.5 Sonnet Qwen2-72B QwQ-32B-Preview o3 Grok 3 (Think) Claude 3.7 Sonnet Grok 3 Beta DeepSeek R1 OpenAI o3-mini GPT-4.5 Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Seed1.5-Thinking GPT‑4.1 nano Gemini 2.0 Flash Claude Sonnet 4 Claude Opus 4 Deepseek-R1-0528 Kimi K2 GPT-5 pro GPT-5 Pro DeepSeek-V3.1-Terminus Claude Sonnet 4.5 GPT-5.2 GPT-4 Claude 3 Opus O1 Claude Opus 4.6 Gemini 3 Pro Gemini 3.1 Pro Preview Aristotle-X1 Gemini 3 Deep Think GPT-5.2 Thinking GPT-5.2 Pro Kimi K2.5 Grok 4 GPT-Live-1 Kimi K3 Inkling-Small Qwen3.8-Max OpenAI o3
Chronologie
Date Modèle Score Source
2026-08-03 Qwen3.8-Max 92.6% Alibaba publie Qwen3.8-Max, un modèle MoE de 2,4 T de paramètres
2026-08-03 Inkling-Small 89.5% Thinking Machines Lab publie Inkling-Small, un modèle MoE multimodal à poids ouverts de 276B
2026-07-17 Kimi K3 93.5% Moonshot AI publie Kimi K3 ouvert, un modèle MoE de 2,8 T de paramètres avec un contexte de 1 M
2026-07-17 GPT-Live-1 84.2% OpenAI publie des modèles vocaux full-duplex et un tribunal allemand tient Google responsable des Résumés IA
2026-03-25 o3 87.7% OpenAI annonce le retrait de o3 de ChatGPT et partage les scores des benchmarks
2026-02-25 Grok 4 87.7% xAI lance le modèle de raisonnement Grok 4 avec des benchmarks agents et de codage puissants
2026-02-05 Claude Opus 4.6 91.3% Anthropic lance Claude Opus 4.6 avec une fenêtre de contexte de 1M et des améliorations agentic
2026-01-27 Kimi K2.5 87.6% Moonshot lance Kimi K2.5 avec la technologie Agent Swarm
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI présente GPT-5.2 avec des capacités de codage, de contexte long et de raisonnement améliorées
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI lance les modèles GPT-5.2 Pro et Thinking pour la science et les mathématiques
2025-12-11 GPT-5.2 Pro 93.2% OpenAI lance les modèles GPT-5.2 Pro et Thinking pour la science et les mathématiques
2025-12-11 GPT-5.2 Pro 93.2% OpenAI présente GPT-5.2 avec des capacités de codage, de contexte long et de raisonnement améliorées
2025-12-04 Gemini 3 Pro 93.0% Epoch AI lance le Hub des Data Centers Frontier et analyse le benchmark OSWorld
2025-11-18 Gemini 3 Pro 91.9% Google lance Gemini 3 Pro avec des capacités de raisonnement et multimodales de pointe
2025-11-18 Gemini 3 Deep Think 93.8% Google lance Gemini 3 Pro avec des capacités de raisonnement et multimodales de pointe
2025-11-18 Gemini 3 Pro 91.9% Google lance Gemini 3 Pro avec des capacités de raisonnement et multimodales de pointe
2025-11-18 Gemini 3 Deep Think 93.8% Google lance Gemini 3 Pro avec des capacités de raisonnement et multimodales de pointe
2025-10-24 GPT-5.2 92.4% Benchmark GPQA-Diamond : Scores, Classement et Comparaison des Modèles IA
2025-10-24 GPT-4 39.0% Benchmark GPQA-Diamond : Scores, Classement et Comparaison des Modèles IA
2025-10-24 Claude 3 Opus 60.0% Benchmark GPQA-Diamond : Scores, Classement et Comparaison des Modèles IA
2025-10-24 O1 77.0% Benchmark GPQA-Diamond : Scores, Classement et Comparaison des Modèles IA
2025-10-24 Claude Opus 4.6 91.3% Benchmark GPQA-Diamond : Scores, Classement et Comparaison des Modèles IA
2025-10-24 Gemini 3 Pro 91.9% Benchmark GPQA-Diamond : Scores, Classement et Comparaison des Modèles IA
2025-10-24 Gemini 3.1 Pro Preview 94.1% Benchmark GPQA-Diamond : Scores, Classement et Comparaison des Modèles IA
2025-10-24 Aristotle-X1 92.4% Benchmark GPQA-Diamond : Scores, Classement et Comparaison des Modèles IA
2025-09-30 Claude Sonnet 4.5 83.4% Anthropic lance Claude Sonnet 4.5 avec des capacités de codage et d'agent améliorées
2025-09-22 DeepSeek-V3.1-Terminus 74.24% DeepSeek publie DeepSeek-V3.1-Terminus avec des correctifs linguistiques et agent
2025-08-07 GPT-5 pro 88.4% OpenAI présente GPT-5 avec routage unifié et raisonnement de niveau expert
2025-08-07 GPT-5 Pro 88.4% OpenAI lance GPT-5 avec raisonnement adaptatif et architecture unifiée
2025-08-07 GPT-5 pro 89.4% OpenAI lance GPT-5 unifié avec routage en temps réel et accès gratuit
2025-07-28 Kimi K2 75.1% Kimi K2 : modèle MoE ouvert avec 1T de paramètres et optimiseur MuonClip
2025-07-28 Kimi K2 75.1% Moonshot lance Kimi K2, un modèle MoE agénique ouvert avec 32 milliards de paramètres activés
2025-05-30 Deepseek-R1-0528 81.0% DeepSeek met à jour le modèle R1 avec des capacités de raisonnement et des scores aux benchmarks améliorés
2025-05-22 Claude Sonnet 4 70.0% Anthropic présente Claude Opus 4 et Sonnet 4 avec réflexion étendue et utilisation d'outils
2025-05-22 Claude Opus 4 74.9% Anthropic publie Claude Opus 4 et Sonnet 4 avec des mesures de sécurité ASL-3
2025-05-22 Claude Opus 4 74.9% Anthropic présente Claude Opus 4 et Sonnet 4 avec réflexion étendue et utilisation d'outils
2025-04-16 OpenAI o3 87.7% OpenAI
2025-04-15 Gemini 2.0 Flash 60.1% Google lance Gemini 2.0 Flash avec une qualité améliorée et deux fois la vitesse de Gemini 1.5 Pro
2025-04-14 GPT‑4.1 nano 50.3% OpenAI lance GPT-4.1, GPT-4.1 mini et GPT-4.1 nano dans l'API
2025-04-10 Seed1.5-Thinking 77.3% Seed1.5-Thinking utilise l'apprentissage par renforcement pour améliorer le raisonnement
2025-04-05 Gemini 2.5 Pro 84.0% Google élargit l'accès à Gemini 2.5 Pro grâce à de solides résultats aux benchmarks
2025-03-26 Gemini 2.5 Pro 84.0% Google publie un modèle de raisonnement expérimental Gemini 2.5 Pro avec un contexte de 1M de tokens
2025-03-25 Gemini 2.5 Pro (experimental) 84.0% Google DeepMind lance le modèle expérimental Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 84.0% Google DeepMind
2025-03-24 DeepSeek-V3-0324 68.4% DeepSeek-V3-0324 améliore le raisonnement, la programmation et l'écriture en chinois par rapport à DeepSeek-V3
2025-03-11 Grok 3 84.6% xAI lance Grok 3 avec raisonnement profond et contexte de million de tokens
2025-03-05 GPT-4.5 71.4% OpenAI publie GPT-4.5, son plus grand modèle, pour ChatGPT Plus
2025-02-26 Claude 3.7 Sonnet 84.8% Comparaison de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 et Grok 3 Beta
2025-02-26 Grok 3 Beta 84.6% Comparaison de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 et Grok 3 Beta
2025-02-26 DeepSeek R1 71.5% Comparaison de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 et Grok 3 Beta
2025-02-26 OpenAI o3-mini 78.0% Comparaison de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 et Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 65.0% Comparaison de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 et Grok 3 Beta
2025-02-24 Claude 3.7 Sonnet 84.8% Anthropic publie Claude 3.7 Sonnet avec contrôle dynamique du raisonnement
2025-02-19 Grok 3 (Think) 84.6% xAI publie Grok 3 Beta et l'agent DeepSearch
2024-12-20 o3 87.7% OpenAI lance le modèle o3 avec des performances élevées en raisonnement et en codage
2024-11-28 QwQ-32B-Preview 65.2% Qwen lance QwQ-32B-Preview, un modèle de raisonnement expérimental
2024-07-15 Qwen2-72B 37.9% L'équipe Qwen publie la série Qwen2 avec des modèles denses et MoE de 72B
2024-07-15 Qwen2-72B 37.9% Le rapport technique Qwen2 présente des modèles denses et MoE jusqu'à 72 milliards de paramètres
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic publie un complément à Claude 3.5 Sonnet avec des benchmarks de codage et de vision améliorés
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic
2023-11-20 GPT-4 based baseline 39.0% GPQA : Un benchmark de Q&A de niveau universitaire, résistant à Google