벤치마크 · reasoning

GPQA Diamond

61 결과 44 모델

GPQA Diamond은 GPQA에서 가장 어려운 부분집합으로, 전문가가 작성한 대학원 수준의 "Google로도 못 푸는" 생물·물리·화학 객관식 문제 모음입니다. 모델은 정답을 고르는 정확도(백분율)로 평가됩니다.

자세히 보기
예시
전형적인 문항은 대학원 수준의 추론이 필요한 어려운 객관식 문제로, 예를 들어 반응 메커니즘을 설명하고 네 개의 선택지 중 어느 것이 올바른 생성물을 주는지 묻는 화학 문제처럼, 비전문가가 웹 검색을 해도 풀 수 없을 만큼 어렵습니다.
채점 방식
점수는 맞힌 문제의 비율(정확도)로, 모델이 올바른 선택지를 고른 문항 수를 전체 문항 수로 나눠 계산합니다.
검증 방식
각 답은 유일하게 알려진 정답 선택지와의 정확 일치로 자동 채점되어 사람의 판단이 필요 없으며, "Diamond"라는 라벨 자체는 데이터셋 구축 시 자격을 갖춘 전문가들이 답에 동의하고 비전문가는 여전히 틀린 문항에 부여되었습니다.
왜 중요한가
이는 (검색으로 찾을 수 있는 지식이 아니라) 진정한 전문가 수준의 과학적 추론을 측정하는 가장 까다로운 시험 중 하나여서, GPQA Diamond의 높은 점수는 최전선 모델이 어렵고 전문적인 문제를 추론할 수 있다는 대표적인 신호입니다.
예제 풀이
문제
전자가 (정규화되지 않은) 스핀 상태 (3i, 4)ᵀ에 있다. y축 방향 스핀 S_y의 기댓값을 구하라. 보기: (A) 12ħ/25 (B) −12ħ/25 (C) 25ħ/2 (D) −25ħ/2.
해답
Norm: |3i|²+|4|²=25. σ_y=[[0,−i],[i,0]]. ⟨S_y⟩=(ħ/2)·(ψ†σ_yψ)/(ψ†ψ)=(ħ/2)·(−24/25)=−12ħ/25 → (B).
풀이
⟨S_y⟩ = ψ†S_yψ / ψ†ψ와 S_y = (ħ/2)σ_y를 사용하면 분자 ψ†σ_yψ = −24, 노름 ψ†ψ = 25이므로 −12ħ/25 (보기 B)가 나온다. GPQA는 선택한 문자가 정답 키와 정확히 일치하는지로 채점한다.
0 25 50 75 100 2023-11-20 2025-03-27 2026-08-03 GPT-4 based baseline · 39 · 2023-11-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 65 · 2025-02-26 Qwen2-72B · 37.9 · 2024-07-15 Qwen2-72B · 37.9 · 2024-07-15 QwQ-32B-Preview · 65.2 · 2024-11-28 o3 · 87.7 · 2024-12-20 o3 · 87.7 · 2026-03-25 Grok 3 (Think) · 84.6 · 2025-02-19 Claude 3.7 Sonnet · 84.8 · 2025-02-24 Claude 3.7 Sonnet · 84.8 · 2025-02-26 Grok 3 Beta · 84.6 · 2025-02-26 DeepSeek R1 · 71.5 · 2025-02-26 OpenAI o3-mini · 78 · 2025-02-26 GPT-4.5 · 71.4 · 2025-03-05 Grok 3 · 84.6 · 2025-03-11 DeepSeek-V3-0324 · 68.4 · 2025-03-24 Gemini 2.5 Pro (experimental) · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-26 Gemini 2.5 Pro · 84 · 2025-04-05 Seed1.5-Thinking · 77.3 · 2025-04-10 GPT‑4.1 nano · 50.3 · 2025-04-14 Gemini 2.0 Flash · 60.1 · 2025-04-15 Claude Sonnet 4 · 70 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Deepseek-R1-0528 · 81 · 2025-05-30 Kimi K2 · 75.1 · 2025-07-28 Kimi K2 · 75.1 · 2025-07-28 GPT-5 pro · 88.4 · 2025-08-07 GPT-5 pro · 89.4 · 2025-08-07 GPT-5 Pro · 88.4 · 2025-08-07 DeepSeek-V3.1-Terminus · 74.2 · 2025-09-22 Claude Sonnet 4.5 · 83.4 · 2025-09-30 GPT-5.2 · 92.4 · 2025-10-24 GPT-4 · 39 · 2025-10-24 Claude 3 Opus · 60 · 2025-10-24 O1 · 77 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2026-02-05 Gemini 3 Pro · 91.9 · 2025-10-24 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 93 · 2025-12-04 Gemini 3.1 Pro Preview · 94.1 · 2025-10-24 Aristotle-X1 · 92.4 · 2025-10-24 Gemini 3 Deep Think · 93.8 · 2025-11-18 Gemini 3 Deep Think · 93.8 · 2025-11-18 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 Kimi K2.5 · 87.6 · 2026-01-27 Grok 4 · 87.7 · 2026-02-25 GPT-Live-1 · 84.2 · 2026-07-17 Kimi K3 · 93.5 · 2026-07-17 Inkling-Small · 89.5 · 2026-08-03 Qwen3.8-Max · 92.6 · 2026-08-03 OpenAI o3 · 87.7 · 2025-04-16
GPT-4 based baseline Claude 3.5 Sonnet Qwen2-72B QwQ-32B-Preview o3 Grok 3 (Think) Claude 3.7 Sonnet Grok 3 Beta DeepSeek R1 OpenAI o3-mini GPT-4.5 Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Seed1.5-Thinking GPT‑4.1 nano Gemini 2.0 Flash Claude Sonnet 4 Claude Opus 4 Deepseek-R1-0528 Kimi K2 GPT-5 pro GPT-5 Pro DeepSeek-V3.1-Terminus Claude Sonnet 4.5 GPT-5.2 GPT-4 Claude 3 Opus O1 Claude Opus 4.6 Gemini 3 Pro Gemini 3.1 Pro Preview Aristotle-X1 Gemini 3 Deep Think GPT-5.2 Thinking GPT-5.2 Pro Kimi K2.5 Grok 4 GPT-Live-1 Kimi K3 Inkling-Small Qwen3.8-Max OpenAI o3
타임라인
날짜 모델 점수 출처
2026-08-03 Qwen3.8-Max 92.6% 알리바바, 2.4조 파라미터 MoE 모델인 Qwen3.8-Max 출시
2026-08-03 Inkling-Small 89.5% Thinking Machines Lab이 276B 오픈 가중치 멀티모달 MoE 모델인 Inkling-Small을 출시
2026-07-17 Kimi K3 93.5% 문샷 AI가 100만 토큰 컨텍스트를 지원하는 2.8T 파라미터 MoE 모델인 오픈 Kimi K3 출시
2026-07-17 GPT-Live-1 84.2% OpenAI, 풀듀플렉스 음성 모델 출시 및 독일 법원이 AI 오버뷰에 대해 구글을 책임 있게 판결
2026-03-25 o3 87.7% OpenAI, ChatGPT에서 o3 은퇴 발표 및 벤치마크 점수 공개
2026-02-25 Grok 4 87.7% xAI, 강력한 에이전트 및 코딩 벤치마크를 갖춘 Grok 4 추론 모델 출시
2026-02-05 Claude Opus 4.6 91.3% Anthropic, 1M 컨텍스트 창과 에이전트 기능 개선을 갖춘 Claude Opus 4.6 출시
2026-01-27 Kimi K2.5 87.6% Moonshot, 에이전트 스웜 기술 탑재 Kimi K2.5 출시
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI, 코드 작성·긴 문맥·추론 능력 개선된 GPT-5.2 출시
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI, 과학 및 수학용 GPT-5.2 Pro 및 Thinking 모델 출시
2025-12-11 GPT-5.2 Pro 93.2% OpenAI, 과학 및 수학용 GPT-5.2 Pro 및 Thinking 모델 출시
2025-12-11 GPT-5.2 Pro 93.2% OpenAI, 코드 작성·긴 문맥·추론 능력 개선된 GPT-5.2 출시
2025-12-04 Gemini 3 Pro 93.0% Epoch AI, 프론티어 데이터 센터 허브 출시 및 OSWorld 벤치마크 분석
2025-11-18 Gemini 3 Pro 91.9% Google, 최첨단 추론 및 멀티모달 기능을 갖춘 Gemini 3 Pro 출시
2025-11-18 Gemini 3 Deep Think 93.8% Google, 최첨단 추론 및 멀티모달 기능을 갖춘 Gemini 3 Pro 출시
2025-11-18 Gemini 3 Pro 91.9% 구글, 최첨단 추론 및 멀티모달 기능을 갖춘 Gemini 3 Pro 출시
2025-11-18 Gemini 3 Deep Think 93.8% 구글, 최첨단 추론 및 멀티모달 기능을 갖춘 Gemini 3 Pro 출시
2025-10-24 GPT-5.2 92.4% GPQA-Diamond 벤치마크: 점수, 리더보드 및 AI 모델 비교
2025-10-24 GPT-4 39.0% GPQA-Diamond 벤치마크: 점수, 리더보드 및 AI 모델 비교
2025-10-24 Claude 3 Opus 60.0% GPQA-Diamond 벤치마크: 점수, 리더보드 및 AI 모델 비교
2025-10-24 O1 77.0% GPQA-Diamond 벤치마크: 점수, 리더보드 및 AI 모델 비교
2025-10-24 Claude Opus 4.6 91.3% GPQA-Diamond 벤치마크: 점수, 리더보드 및 AI 모델 비교
2025-10-24 Gemini 3 Pro 91.9% GPQA-Diamond 벤치마크: 점수, 리더보드 및 AI 모델 비교
2025-10-24 Gemini 3.1 Pro Preview 94.1% GPQA-Diamond 벤치마크: 점수, 리더보드 및 AI 모델 비교
2025-10-24 Aristotle-X1 92.4% GPQA-Diamond 벤치마크: 점수, 리더보드 및 AI 모델 비교
2025-09-30 Claude Sonnet 4.5 83.4% Anthropic, 코딩 및 에이전트 기능 강화된 Claude Sonnet 4.5 출시
2025-09-22 DeepSeek-V3.1-Terminus 74.24% DeepSeek, 언어 및 에이전트 수정이 적용된 DeepSeek-V3.1-Terminus 출시
2025-08-07 GPT-5 pro 88.4% OpenAI가 통합 라우팅과 전문가 수준의 추론을 갖춘 GPT-5를 출시하다
2025-08-07 GPT-5 Pro 88.4% OpenAI, 적응형 추론과 통합 아키텍처를 갖춘 GPT-5 출시
2025-08-07 GPT-5 pro 89.4% OpenAI, 실시간 라우팅과 무료 접근성을 갖춘 통합 GPT-5 출시
2025-07-28 Kimi K2 75.1% Kimi K2: 1조 파라미터와 MuonClip 옵티마이저를 갖춘 오픈 MoE 모델
2025-07-28 Kimi K2 75.1% Moonshot, 32B 활성화 파라미터를 가진 오픈 에이전트 MoE 모델 Kimi K2 출시
2025-05-30 Deepseek-R1-0528 81.0% DeepSeek, 향상된 추론 및 벤치마크 점수로 R1 모델 업데이트
2025-05-22 Claude Sonnet 4 70.0% Anthropic, 확장된 사고와 도구 사용 기능을 갖춘 Claude Opus 4 및 Sonnet 4 출시
2025-05-22 Claude Opus 4 74.9% Anthropic이 ASL-3 안전 조치를 갖춘 Claude Opus 4와 Sonnet 4를 출시
2025-05-22 Claude Opus 4 74.9% Anthropic, 확장된 사고와 도구 사용 기능을 갖춘 Claude Opus 4 및 Sonnet 4 출시
2025-04-16 OpenAI o3 87.7% OpenAI
2025-04-15 Gemini 2.0 Flash 60.1% 구글, Gemini 1.5 Pro보다 두 배 빠른 속도와 향상된 품질의 Gemini 2.0 Flash 출시
2025-04-14 GPT‑4.1 nano 50.3% OpenAI, API에 GPT-4.1, GPT-4.1 mini, GPT-4.1 nano 출시
2025-04-10 Seed1.5-Thinking 77.3% Seed1.5-Thinking은 강화학습을 사용하여 추론을 개선합니다
2025-04-05 Gemini 2.5 Pro 84.0% 강력한 벤치마크 결과에 힘입어 Gemini 2.5 Pro 접근성 확대
2025-03-26 Gemini 2.5 Pro 84.0% 구글, 100만 토큰 컨텍스트를 지원하는 실험용 Gemini 2.5 Pro 추론 모델 출시
2025-03-25 Gemini 2.5 Pro (experimental) 84.0% Google DeepMind, Gemini 2.5 Pro 실험 모델 출시
2025-03-25 Gemini 2.5 Pro 84.0% Google DeepMind
2025-03-24 DeepSeek-V3-0324 68.4% DeepSeek-V3-0324은 DeepSeek-V3 대비 추론, 코딩, 중국어 작문 능력을 향상
2025-03-11 Grok 3 84.6% xAI, 심층 추론과 백만 토큰 컨텍스트를 갖춘 Grok 3 출시
2025-03-05 GPT-4.5 71.4% 오픈에이아이, 차트GPT 플러스용 최대 규모 모델 GPT-4.5 출시
2025-02-26 Claude 3.7 Sonnet 84.8% Claude 3.7 Sonnet, o3-mini, R1, Grok 3 Beta의 벤치마크 비교
2025-02-26 Grok 3 Beta 84.6% Claude 3.7 Sonnet, o3-mini, R1, Grok 3 Beta의 벤치마크 비교
2025-02-26 DeepSeek R1 71.5% Claude 3.7 Sonnet, o3-mini, R1, Grok 3 Beta의 벤치마크 비교
2025-02-26 OpenAI o3-mini 78.0% Claude 3.7 Sonnet, o3-mini, R1, Grok 3 Beta의 벤치마크 비교
2025-02-26 Claude 3.5 Sonnet 65.0% Claude 3.7 Sonnet, o3-mini, R1, Grok 3 Beta의 벤치마크 비교
2025-02-24 Claude 3.7 Sonnet 84.8% Anthropic, 동적 추론 제어가 가능한 Claude 3.7 Sonnet 출시
2025-02-19 Grok 3 (Think) 84.6% xAI가 Grok 3 베타 및 DeepSearch 에이전트 출시
2024-12-20 o3 87.7% OpenAI, 추론 및 코딩에서 높은 성능을 갖춘 o3 모델 출시
2024-11-28 QwQ-32B-Preview 65.2% Qwen, 실험적 추론 모델 QwQ-32B-Preview 출시
2024-07-15 Qwen2-72B 37.9% Qwen 팀, 72B 밀집 및 MoE 모델이 포함된 Qwen2 시리즈 출시
2024-07-15 Qwen2-72B 37.9% Qwen2 기술 보고서: 최대 72B 규모의 밀집형 및 MoE 모델 소개
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic, Claude 3.5 Sonnet의 향상된 코딩 및 비전 벤치마크를 포함한 추가 문서 출시
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic
2023-11-20 GPT-4 based baseline 39.0% GPQA: 대학원 수준의 Google 방지 Q&A 벤치마크