Benchmark · reasoning

GPQA Diamond

61 条结果 44 个模型

GPQA Diamond 是 GPQA 中最难的子集,由领域专家编写的研究生水平、"防 Google"的生物、物理和化学多项选择题组成。模型按选对正确答案的准确率(百分比)来评分。

了解更多
示例
典型题目是一道需要研究生水平推理的高难度多项选择题,例如一道化学题,描述某个反应机理并问四个选项中哪一个给出正确产物,难到非专家即使用网络搜索也答不出来。
评分方式
分数是答对题目的百分比(准确率):模型选对选项的题目数除以题目总数。
验证方式
每个答案都通过与唯一已知正确选项的精确匹配自动评判,无需人工判定;"Diamond"这一标签本身是在构建数据集时确定的——当合格专家对答案达成一致而非专家仍然答错时。
为何重要
它是对真正的专家级科学推理(而非可查到的事实)最严苛的测试之一,因此在 GPQA Diamond 上取得高分是前沿模型能够攻克高难度专业问题的重要标志。
示例解析
任务
一个电子处于(未归一化的)自旋态 (3i, 4)ᵀ。求其自旋沿 y 轴分量 S_y 的期望值。选项:(A) 12ħ/25 (B) −12ħ/25 (C) 25ħ/2 (D) −25ħ/2。
解答
Norm: |3i|²+|4|²=25. σ_y=[[0,−i],[i,0]]. ⟨S_y⟩=(ħ/2)·(ψ†σ_yψ)/(ψ†ψ)=(ħ/2)·(−24/25)=−12ħ/25 → (B).
解析
由 ⟨S_y⟩ = ψ†S_yψ / ψ†ψ 且 S_y = (ħ/2)σ_y,分子 ψ†σ_yψ = −24,模方 ψ†ψ = 25,得 −12ħ/25(选项 B)。GPQA 依据所选字母与标准答案是否精确一致来评分。
0 25 50 75 100 2023-11-20 2025-03-27 2026-08-03 GPT-4 based baseline · 39 · 2023-11-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 65 · 2025-02-26 Qwen2-72B · 37.9 · 2024-07-15 Qwen2-72B · 37.9 · 2024-07-15 QwQ-32B-Preview · 65.2 · 2024-11-28 o3 · 87.7 · 2024-12-20 o3 · 87.7 · 2026-03-25 Grok 3 (Think) · 84.6 · 2025-02-19 Claude 3.7 Sonnet · 84.8 · 2025-02-24 Claude 3.7 Sonnet · 84.8 · 2025-02-26 Grok 3 Beta · 84.6 · 2025-02-26 DeepSeek R1 · 71.5 · 2025-02-26 OpenAI o3-mini · 78 · 2025-02-26 GPT-4.5 · 71.4 · 2025-03-05 Grok 3 · 84.6 · 2025-03-11 DeepSeek-V3-0324 · 68.4 · 2025-03-24 Gemini 2.5 Pro (experimental) · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-26 Gemini 2.5 Pro · 84 · 2025-04-05 Seed1.5-Thinking · 77.3 · 2025-04-10 GPT‑4.1 nano · 50.3 · 2025-04-14 Gemini 2.0 Flash · 60.1 · 2025-04-15 Claude Sonnet 4 · 70 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Deepseek-R1-0528 · 81 · 2025-05-30 Kimi K2 · 75.1 · 2025-07-28 Kimi K2 · 75.1 · 2025-07-28 GPT-5 pro · 88.4 · 2025-08-07 GPT-5 pro · 89.4 · 2025-08-07 GPT-5 Pro · 88.4 · 2025-08-07 DeepSeek-V3.1-Terminus · 74.2 · 2025-09-22 Claude Sonnet 4.5 · 83.4 · 2025-09-30 GPT-5.2 · 92.4 · 2025-10-24 GPT-4 · 39 · 2025-10-24 Claude 3 Opus · 60 · 2025-10-24 O1 · 77 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2026-02-05 Gemini 3 Pro · 91.9 · 2025-10-24 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 93 · 2025-12-04 Gemini 3.1 Pro Preview · 94.1 · 2025-10-24 Aristotle-X1 · 92.4 · 2025-10-24 Gemini 3 Deep Think · 93.8 · 2025-11-18 Gemini 3 Deep Think · 93.8 · 2025-11-18 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 Kimi K2.5 · 87.6 · 2026-01-27 Grok 4 · 87.7 · 2026-02-25 GPT-Live-1 · 84.2 · 2026-07-17 Kimi K3 · 93.5 · 2026-07-17 Inkling-Small · 89.5 · 2026-08-03 Qwen3.8-Max · 92.6 · 2026-08-03 OpenAI o3 · 87.7 · 2025-04-16
GPT-4 based baseline Claude 3.5 Sonnet Qwen2-72B QwQ-32B-Preview o3 Grok 3 (Think) Claude 3.7 Sonnet Grok 3 Beta DeepSeek R1 OpenAI o3-mini GPT-4.5 Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Seed1.5-Thinking GPT‑4.1 nano Gemini 2.0 Flash Claude Sonnet 4 Claude Opus 4 Deepseek-R1-0528 Kimi K2 GPT-5 pro GPT-5 Pro DeepSeek-V3.1-Terminus Claude Sonnet 4.5 GPT-5.2 GPT-4 Claude 3 Opus O1 Claude Opus 4.6 Gemini 3 Pro Gemini 3.1 Pro Preview Aristotle-X1 Gemini 3 Deep Think GPT-5.2 Thinking GPT-5.2 Pro Kimi K2.5 Grok 4 GPT-Live-1 Kimi K3 Inkling-Small Qwen3.8-Max OpenAI o3
时间线
日期 模型 得分 来源
2026-08-03 Qwen3.8-Max 92.6% 阿里巴巴发布Qwen3.8-Max,一款拥有2.4万亿参数的MoE模型
2026-08-03 Inkling-Small 89.5% Thinking Machines Lab 发布 Inkling-Small,一款拥有 276B 开放权重的多模态 MoE 模型
2026-07-17 Kimi K3 93.5% 月之暗面发布开源 Kimi K3,拥有 2.8T 参数和 100 万上下文的 MoE 模型
2026-07-17 GPT-Live-1 84.2% OpenAI 发布全双工语音模型,德国法院判定谷歌对 AI 概览内容承担责任
2026-03-25 o3 87.7% OpenAI 宣布从 ChatGPT 中退役 o3 并分享基准测试分数
2026-02-25 Grok 4 87.7% xAI 发布 Grok 4 推理模型,在智能体和编码基准测试中表现强劲
2026-02-05 Claude Opus 4.6 91.3% Anthropic 发布 Claude Opus 4.6,具备 1M 上下文窗口和智能体改进
2026-01-27 Kimi K2.5 87.6% Moonshot发布搭载Agent Swarm技术的Kimi K2.5
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI 推出 GPT-5.2,具备改进的代码编写、长上下文和推理能力
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI 发布 GPT-5.2 Pro 和 Thinking 模型,助力科学与数学
2025-12-11 GPT-5.2 Pro 93.2% OpenAI 发布 GPT-5.2 Pro 和 Thinking 模型,助力科学与数学
2025-12-11 GPT-5.2 Pro 93.2% OpenAI 推出 GPT-5.2,具备改进的代码编写、长上下文和推理能力
2025-12-04 Gemini 3 Pro 93.0% Epoch AI 推出前沿数据中心中心并分析 OSWorld 基准
2025-11-18 Gemini 3 Pro 91.9% Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
2025-11-18 Gemini 3 Deep Think 93.8% Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
2025-11-18 Gemini 3 Pro 91.9% Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
2025-11-18 Gemini 3 Deep Think 93.8% Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
2025-10-24 GPT-5.2 92.4% GPQA-Diamond 基准:分数、排行榜及 AI 模型对比
2025-10-24 GPT-4 39.0% GPQA-Diamond 基准:分数、排行榜及 AI 模型对比
2025-10-24 Claude 3 Opus 60.0% GPQA-Diamond 基准:分数、排行榜及 AI 模型对比
2025-10-24 O1 77.0% GPQA-Diamond 基准:分数、排行榜及 AI 模型对比
2025-10-24 Claude Opus 4.6 91.3% GPQA-Diamond 基准:分数、排行榜及 AI 模型对比
2025-10-24 Gemini 3 Pro 91.9% GPQA-Diamond 基准:分数、排行榜及 AI 模型对比
2025-10-24 Gemini 3.1 Pro Preview 94.1% GPQA-Diamond 基准:分数、排行榜及 AI 模型对比
2025-10-24 Aristotle-X1 92.4% GPQA-Diamond 基准:分数、排行榜及 AI 模型对比
2025-09-30 Claude Sonnet 4.5 83.4% Anthropic 发布 Claude Sonnet 4.5,增强编码与智能体能力
2025-09-22 DeepSeek-V3.1-Terminus 74.24% DeepSeek发布DeepSeek-V3.1-Terminus,修复语言和代理问题
2025-08-07 GPT-5 pro 88.4% OpenAI 推出 GPT-5,具备统一路由与专家级推理能力
2025-08-07 GPT-5 Pro 88.4% OpenAI 发布具备自适应推理与统一架构的 GPT-5
2025-08-07 GPT-5 pro 89.4% OpenAI 推出统一版 GPT-5,支持实时路由并提供免费访问
2025-07-28 Kimi K2 75.1% Kimi K2:拥有1T参数和MuonClip优化器的开源MoE模型
2025-07-28 Kimi K2 75.1% Moonshot发布Kimi K2,一款拥有32B激活参数的开放智能体MoE模型
2025-05-30 Deepseek-R1-0528 81.0% DeepSeek更新R1模型,提升推理能力与基准测试成绩
2025-05-22 Claude Sonnet 4 70.0% Anthropic 推出支持扩展思考与工具使用的 Claude Opus 4 和 Sonnet 4
2025-05-22 Claude Opus 4 74.9% Anthropic发布Claude Opus 4和Sonnet 4,配备ASL-3安全措施
2025-05-22 Claude Opus 4 74.9% Anthropic 推出支持扩展思考与工具使用的 Claude Opus 4 和 Sonnet 4
2025-04-16 OpenAI o3 87.7% OpenAI
2025-04-15 Gemini 2.0 Flash 60.1% Google 发布 Gemini 2.0 Flash,质量提升且速度是 Gemini 1.5 Pro 的两倍
2025-04-14 GPT‑4.1 nano 50.3% OpenAI在API中推出GPT-4.1、GPT-4.1 mini和GPT-4.1 nano
2025-04-10 Seed1.5-Thinking 77.3% Seed1.5-Thinking 使用强化学习提升推理能力
2025-04-05 Gemini 2.5 Pro 84.0% Google在强劲基准测试结果推动下扩大Gemini 2.5 Pro访问权限
2025-03-26 Gemini 2.5 Pro 84.0% Google 发布实验性 Gemini 2.5 Pro 推理模型,支持 100 万 token 上下文
2025-03-25 Gemini 2.5 Pro (experimental) 84.0% Google DeepMind 发布 Gemini 2.5 Pro 实验模型
2025-03-25 Gemini 2.5 Pro 84.0% Google DeepMind
2025-03-24 DeepSeek-V3-0324 68.4% DeepSeek-V3-0324 在推理、编码和中文写作方面优于 DeepSeek-V3
2025-03-11 Grok 3 84.6% xAI发布具有深度推理和百万token上下文的Grok 3
2025-03-05 GPT-4.5 71.4% OpenAI发布GPT-4.5,其为ChatGPT Plus推出的最大模型
2025-02-26 Claude 3.7 Sonnet 84.8% Claude 3.7 Sonnet、o3-mini、R1 和 Grok 3 Beta 的基准测试对比
2025-02-26 Grok 3 Beta 84.6% Claude 3.7 Sonnet、o3-mini、R1 和 Grok 3 Beta 的基准测试对比
2025-02-26 DeepSeek R1 71.5% Claude 3.7 Sonnet、o3-mini、R1 和 Grok 3 Beta 的基准测试对比
2025-02-26 OpenAI o3-mini 78.0% Claude 3.7 Sonnet、o3-mini、R1 和 Grok 3 Beta 的基准测试对比
2025-02-26 Claude 3.5 Sonnet 65.0% Claude 3.7 Sonnet、o3-mini、R1 和 Grok 3 Beta 的基准测试对比
2025-02-24 Claude 3.7 Sonnet 84.8% Anthropic 发布 Claude 3.7 Sonnet,支持动态推理控制
2025-02-19 Grok 3 (Think) 84.6% xAI发布Grok 3 Beta版和DeepSearch智能体
2024-12-20 o3 87.7% OpenAI 发布 o3 模型,在推理和编程方面表现卓越
2024-11-28 QwQ-32B-Preview 65.2% Qwen发布QwQ-32B-Preview,一款实验性推理模型
2024-07-15 Qwen2-72B 37.9% Qwen团队发布Qwen2系列,包含72B密集模型和MoE模型
2024-07-15 Qwen2-72B 37.9% Qwen2 技术报告介绍高达 72B 的密集和 MoE 模型
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic发布Claude 3.5 Sonnet附录,提升编码与视觉基准表现
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic
2023-11-20 GPT-4 based baseline 39.0% GPQA:研究生级别的防Google问答基准