ベンチマーク · reasoning

GPQA Diamond

61 結果 44 モデル

GPQA Diamond は GPQA の中で最も難しいサブセットで、専門家が作成した大学院レベルかつ「Google で調べても解けない」生物・物理・化学の多肢選択問題の集合です。モデルは正解を選ぶ正答率(パーセント)で評価されます。

詳しく見る
典型的な問題は大学院レベルの推論を要する難しい多肢選択問題で、例えば反応機構を説明したうえで4つの選択肢のどれが正しい生成物かを問う化学の問題など、非専門家がウェブ検索を使っても解けないほど難しいものです。
採点方法
スコアは正答した問題の割合(正答率)で、モデルが正しい選択肢を選んだ問題数を全問題数で割って求めます。
検証方法
各回答は唯一の既知の正解選択肢との完全一致で自動採点されるため人間の判定は不要で、「Diamond」というラベル自体はデータセット作成時に、資格ある専門家が答えに一致し非専門家は依然として間違えた問題に付けられました。
重要な理由
これは(検索で調べられる知識ではなく)真に専門家レベルの科学的推論を測る最も厳しいテストの一つであり、GPQA Diamond での高スコアは、最先端モデルが難しく専門的な問題を推論できることを示す重要なシグナルとなります。
解説付きの例
課題
電子が(規格化されていない)スピン状態 (3i, 4)ᵀ にある。y 軸方向のスピン S_y の期待値を求めよ。選択肢:(A) 12ħ/25 (B) −12ħ/25 (C) 25ħ/2 (D) −25ħ/2。
解答
Norm: |3i|²+|4|²=25. σ_y=[[0,−i],[i,0]]. ⟨S_y⟩=(ħ/2)·(ψ†σ_yψ)/(ψ†ψ)=(ħ/2)·(−24/25)=−12ħ/25 → (B).
解説
⟨S_y⟩ = ψ†S_yψ / ψ†ψ と S_y = (ħ/2)σ_y を用いると、分子 ψ†σ_yψ = −24、ノルム ψ†ψ = 25 となり、−12ħ/25(選択肢 B)が得られる。GPQA は選んだ記号が正解キーと完全一致するかで採点する。
0 25 50 75 100 2023-11-20 2025-03-27 2026-08-03 GPT-4 based baseline · 39 · 2023-11-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 65 · 2025-02-26 Qwen2-72B · 37.9 · 2024-07-15 Qwen2-72B · 37.9 · 2024-07-15 QwQ-32B-Preview · 65.2 · 2024-11-28 o3 · 87.7 · 2024-12-20 o3 · 87.7 · 2026-03-25 Grok 3 (Think) · 84.6 · 2025-02-19 Claude 3.7 Sonnet · 84.8 · 2025-02-24 Claude 3.7 Sonnet · 84.8 · 2025-02-26 Grok 3 Beta · 84.6 · 2025-02-26 DeepSeek R1 · 71.5 · 2025-02-26 OpenAI o3-mini · 78 · 2025-02-26 GPT-4.5 · 71.4 · 2025-03-05 Grok 3 · 84.6 · 2025-03-11 DeepSeek-V3-0324 · 68.4 · 2025-03-24 Gemini 2.5 Pro (experimental) · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-26 Gemini 2.5 Pro · 84 · 2025-04-05 Seed1.5-Thinking · 77.3 · 2025-04-10 GPT‑4.1 nano · 50.3 · 2025-04-14 Gemini 2.0 Flash · 60.1 · 2025-04-15 Claude Sonnet 4 · 70 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Deepseek-R1-0528 · 81 · 2025-05-30 Kimi K2 · 75.1 · 2025-07-28 Kimi K2 · 75.1 · 2025-07-28 GPT-5 pro · 88.4 · 2025-08-07 GPT-5 pro · 89.4 · 2025-08-07 GPT-5 Pro · 88.4 · 2025-08-07 DeepSeek-V3.1-Terminus · 74.2 · 2025-09-22 Claude Sonnet 4.5 · 83.4 · 2025-09-30 GPT-5.2 · 92.4 · 2025-10-24 GPT-4 · 39 · 2025-10-24 Claude 3 Opus · 60 · 2025-10-24 O1 · 77 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2026-02-05 Gemini 3 Pro · 91.9 · 2025-10-24 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 93 · 2025-12-04 Gemini 3.1 Pro Preview · 94.1 · 2025-10-24 Aristotle-X1 · 92.4 · 2025-10-24 Gemini 3 Deep Think · 93.8 · 2025-11-18 Gemini 3 Deep Think · 93.8 · 2025-11-18 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 Kimi K2.5 · 87.6 · 2026-01-27 Grok 4 · 87.7 · 2026-02-25 GPT-Live-1 · 84.2 · 2026-07-17 Kimi K3 · 93.5 · 2026-07-17 Inkling-Small · 89.5 · 2026-08-03 Qwen3.8-Max · 92.6 · 2026-08-03 OpenAI o3 · 87.7 · 2025-04-16
GPT-4 based baseline Claude 3.5 Sonnet Qwen2-72B QwQ-32B-Preview o3 Grok 3 (Think) Claude 3.7 Sonnet Grok 3 Beta DeepSeek R1 OpenAI o3-mini GPT-4.5 Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Seed1.5-Thinking GPT‑4.1 nano Gemini 2.0 Flash Claude Sonnet 4 Claude Opus 4 Deepseek-R1-0528 Kimi K2 GPT-5 pro GPT-5 Pro DeepSeek-V3.1-Terminus Claude Sonnet 4.5 GPT-5.2 GPT-4 Claude 3 Opus O1 Claude Opus 4.6 Gemini 3 Pro Gemini 3.1 Pro Preview Aristotle-X1 Gemini 3 Deep Think GPT-5.2 Thinking GPT-5.2 Pro Kimi K2.5 Grok 4 GPT-Live-1 Kimi K3 Inkling-Small Qwen3.8-Max OpenAI o3
タイムライン
日付 モデル スコア ソース
2026-08-03 Qwen3.8-Max 92.6% アリババが2.4兆パラメータのMoEモデル「Qwen3.8-Max」をリリース
2026-08-03 Inkling-Small 89.5% Thinking Machines Labが276Bのオープンウェイト多モーダルMoEモデルInkling-Smallをリリース
2026-07-17 Kimi K3 93.5% Moonshot AIが2.8TパラメータのMoEモデル「Kimi K3」を1Mコンテキストで公開
2026-07-17 GPT-Live-1 84.2% OpenAIがフルデュプレックス音声モデルをリリース、ドイツの裁判所がGoogleにAIオーバビューの責任を課す
2026-03-25 o3 87.7% OpenAI、ChatGPTからo3の退役を発表しベンチマークスコアを公開
2026-02-25 Grok 4 87.7% xAI、強力なエージェントおよびコーディングベンチマークを備えたGrok 4推論モデルをリリース
2026-02-05 Claude Opus 4.6 91.3% Anthropicが1Mコンテキストウィンドウとエージェント機能の改善を備えたClaude Opus 4.6をリリース
2026-01-27 Kimi K2.5 87.6% Moonshotがエージェントスワーム技術搭載のKimi K2.5をリリース
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI、コード記述・長文脈・推論能力を強化したGPT-5.2を発表
2025-12-11 GPT-5.2 Thinking 92.4% OpenAIが科学と数学向けにGPT-5.2 ProおよびThinkingモデルをリリース
2025-12-11 GPT-5.2 Pro 93.2% OpenAIが科学と数学向けにGPT-5.2 ProおよびThinkingモデルをリリース
2025-12-11 GPT-5.2 Pro 93.2% OpenAI、コード記述・長文脈・推論能力を強化したGPT-5.2を発表
2025-12-04 Gemini 3 Pro 93.0% Epoch AIがフロンティアデータセンターハブを立ち上げ、OSWorldベンチマークを分析
2025-11-18 Gemini 3 Pro 91.9% Google、最先端の推論とマルチモーダル機能を備えたGemini 3 Proをリリース
2025-11-18 Gemini 3 Deep Think 93.8% Google、最先端の推論とマルチモーダル機能を備えたGemini 3 Proをリリース
2025-11-18 Gemini 3 Pro 91.9% GoogleがGemini 3 Proをリリース、最先端の推論とマルチモーダル能力を搭載
2025-11-18 Gemini 3 Deep Think 93.8% GoogleがGemini 3 Proをリリース、最先端の推論とマルチモーダル能力を搭載
2025-10-24 GPT-5.2 92.4% GPQA-Diamondベンチマーク:スコア、リーダーボード、AIモデルの比較
2025-10-24 GPT-4 39.0% GPQA-Diamondベンチマーク:スコア、リーダーボード、AIモデルの比較
2025-10-24 Claude 3 Opus 60.0% GPQA-Diamondベンチマーク:スコア、リーダーボード、AIモデルの比較
2025-10-24 O1 77.0% GPQA-Diamondベンチマーク:スコア、リーダーボード、AIモデルの比較
2025-10-24 Claude Opus 4.6 91.3% GPQA-Diamondベンチマーク:スコア、リーダーボード、AIモデルの比較
2025-10-24 Gemini 3 Pro 91.9% GPQA-Diamondベンチマーク:スコア、リーダーボード、AIモデルの比較
2025-10-24 Gemini 3.1 Pro Preview 94.1% GPQA-Diamondベンチマーク:スコア、リーダーボード、AIモデルの比較
2025-10-24 Aristotle-X1 92.4% GPQA-Diamondベンチマーク:スコア、リーダーボード、AIモデルの比較
2025-09-30 Claude Sonnet 4.5 83.4% AnthropicがClaude Sonnet 4.5をリリース、コーディングとエージェント機能が強化
2025-09-22 DeepSeek-V3.1-Terminus 74.24% DeepSeekが言語およびエージェントの修正を施したDeepSeek-V3.1-Terminusをリリース
2025-08-07 GPT-5 pro 88.4% OpenAIが統一ルーティングと専門レベルの推論を備えたGPT-5を発表
2025-08-07 GPT-5 Pro 88.4% OpenAIが適応的推論と統一アーキテクチャを搭載したGPT-5をリリース
2025-08-07 GPT-5 pro 89.4% OpenAIがリアルタイムルーティングと無料アクセスを備えた統合GPT-5を発表
2025-07-28 Kimi K2 75.1% Kimi K2: 1兆パラメータのオープンなMoEモデルとMuonClipオプティマイザ
2025-07-28 Kimi K2 75.1% Moonshotが32Bの活性化パラメータを持つオープンなエージェント型MoEモデル「Kimi K2」をリリース
2025-05-30 Deepseek-R1-0528 81.0% DeepSeekがR1モデルを更新し、推論能力とベンチマークスコアを向上
2025-05-22 Claude Sonnet 4 70.0% AnthropicがClaude Opus 4とSonnet 4を、拡張思考とツール使用機能付きで発表
2025-05-22 Claude Opus 4 74.9% AnthropicがClaude Opus 4およびSonnet 4をASL-3の安全対策付きでリリース
2025-05-22 Claude Opus 4 74.9% AnthropicがClaude Opus 4とSonnet 4を、拡張思考とツール使用機能付きで発表
2025-04-16 OpenAI o3 87.7% OpenAI
2025-04-15 Gemini 2.0 Flash 60.1% Google、Gemini 1.5 Proの2倍の速度と向上した品質を持つGemini 2.0 Flashをリリース
2025-04-14 GPT‑4.1 nano 50.3% OpenAIがAPIでGPT-4.1、GPT-4.1 mini、GPT-4.1 nanoをリリース
2025-04-10 Seed1.5-Thinking 77.3% Seed1.5-Thinking は強化学習を用いて推論能力を向上させる
2025-04-05 Gemini 2.5 Pro 84.0% Google、強力なベンチマーク結果を背景にGemini 2.5 Proへのアクセスを拡大
2025-03-26 Gemini 2.5 Pro 84.0% Googleが100万トークンコンテキストを備えた実験的なGemini 2.5 Pro推論モデルをリリース
2025-03-25 Gemini 2.5 Pro (experimental) 84.0% Google DeepMind、Gemini 2.5 Pro 実験モデルをリリース
2025-03-25 Gemini 2.5 Pro 84.0% Google DeepMind
2025-03-24 DeepSeek-V3-0324 68.4% DeepSeek-V3-0324は、DeepSeek-V3と比較して推論、コーディング、中国語の文章作成を改善
2025-03-11 Grok 3 84.6% xAIが深層推論と100万トークンのコンテキストを持つGrok 3をリリース
2025-03-05 GPT-4.5 71.4% OpenAI、ChatGPT Plus向けに最大規模モデルGPT-4.5をリリース
2025-02-26 Claude 3.7 Sonnet 84.8% Claude 3.7 Sonnet、o3-mini、R1、Grok 3 Betaのベンチマーク比較
2025-02-26 Grok 3 Beta 84.6% Claude 3.7 Sonnet、o3-mini、R1、Grok 3 Betaのベンチマーク比較
2025-02-26 DeepSeek R1 71.5% Claude 3.7 Sonnet、o3-mini、R1、Grok 3 Betaのベンチマーク比較
2025-02-26 OpenAI o3-mini 78.0% Claude 3.7 Sonnet、o3-mini、R1、Grok 3 Betaのベンチマーク比較
2025-02-26 Claude 3.5 Sonnet 65.0% Claude 3.7 Sonnet、o3-mini、R1、Grok 3 Betaのベンチマーク比較
2025-02-24 Claude 3.7 Sonnet 84.8% Anthropicが動的推論制御機能を備えたClaude 3.7 Sonnetをリリース
2025-02-19 Grok 3 (Think) 84.6% xAIがGrok 3 BetaとDeepSearchエージェントをリリース
2024-12-20 o3 87.7% OpenAI、推論とコーディングで高性能なモデルo3をリリース
2024-11-28 QwQ-32B-Preview 65.2% Qwenが実験的推論モデル「QwQ-32B-Preview」をリリース
2024-07-15 Qwen2-72B 37.9% Qwenチームが72BのDenseおよびMoEモデルを含むQwen2シリーズをリリース
2024-07-15 Qwen2-72B 37.9% Qwen2技術レポートは72Bまでの密集型およびMoEモデルを紹介
2024-06-20 Claude 3.5 Sonnet 59.4% AnthropicがClaude 3.5 Sonnetの補遺をリリースし、コーディングとビジョンベンチマークが改善
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic
2023-11-20 GPT-4 based baseline 39.0% GPQA: 大学院レベルのGoogle耐性Q&Aベンチマーク