Benchmark · reasoning

GPQA Diamond

69 परिणाम 52 मॉडल

GPQA Diamond, GPQA का सबसे कठिन उपसमूह है — विशेषज्ञों द्वारा लिखे गए स्नातकोत्तर स्तर के और "Google-प्रूफ़" बहुविकल्पीय विज्ञान प्रश्नों (जीवविज्ञान, भौतिकी, रसायन) का संग्रह। मॉडल का मूल्यांकन सही उत्तर चुनने की प्रतिशत सटीकता से होता है।

और पढ़ें
उदाहरण
एक सामान्य प्रश्न स्नातकोत्तर-स्तरीय तर्क माँगने वाला कठिन बहुविकल्पीय प्रश्न होता है; उदाहरण के लिए, एक रसायन विज्ञान का प्रश्न जो किसी अभिक्रिया-तंत्र का वर्णन करता है और पूछता है कि चार विकल्पों में से कौन-सा सही उत्पाद देता है, इतना कठिन कि गैर-विशेषज्ञ वेब सर्च से भी हल नहीं कर पाता।
स्कोरिंग
स्कोर सही उत्तर दिए गए प्रश्नों का प्रतिशत (सटीकता) है: जिन प्रश्नों में मॉडल सही विकल्प चुनता है उनकी संख्या को कुल प्रश्नों की संख्या से भाग देकर।
सत्यापन
हर उत्तर को एकमात्र ज्ञात सही विकल्प से सटीक मिलान द्वारा स्वचालित रूप से जाँचा जाता है, इसलिए किसी मानवीय निर्णय की आवश्यकता नहीं; "Diamond" का लेबल डेटासेट बनाते समय ही दिया गया था — जब योग्य विशेषज्ञ उत्तर पर सहमत हुए और गैर-विशेषज्ञ फिर भी गलत रहे।
यह क्यों मायने रखता है
यह असली विशेषज्ञ-स्तरीय वैज्ञानिक तर्क (न कि खोजे जा सकने वाले तथ्यों) की सबसे कठिन परीक्षाओं में से एक है, इसलिए GPQA Diamond पर ऊँचा स्कोर इस बात का प्रमुख संकेत है कि कोई अग्रणी मॉडल कठिन, विशिष्ट समस्याओं पर तर्क कर सकता है।
हल किया गया उदाहरण
कार्य
एक इलेक्ट्रॉन (बिना सामान्यीकृत) स्पिन अवस्था (3i, 4)ᵀ में है। y-अक्ष के अनुदिश उसके स्पिन S_y का अपेक्षित मान ज्ञात कीजिए। विकल्प: (A) 12ħ/25 (B) −12ħ/25 (C) 25ħ/2 (D) −25ħ/2।
समाधान
Norm: |3i|²+|4|²=25. σ_y=[[0,−i],[i,0]]. ⟨S_y⟩=(ħ/2)·(ψ†σ_yψ)/(ψ†ψ)=(ħ/2)·(−24/25)=−12ħ/25 → (B).
व्याख्या
⟨S_y⟩ = ψ†S_yψ / ψ†ψ और S_y = (ħ/2)σ_y का उपयोग करने पर अंश ψ†σ_yψ = −24 तथा मान ψ†ψ = 25 मिलता है, जिससे −12ħ/25 (विकल्प B) प्राप्त होता है। GPQA चुने गए अक्षर का सही उत्तर से पूर्ण मिलान करके अंक देता है।
0 25 50 75 100 2023-11-20 2025-04-25 2026-09-29 GPT-4 based baseline · 39 · 2023-11-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 65 · 2025-02-26 Qwen2-72B · 37.9 · 2024-07-15 Qwen2-72B · 37.9 · 2024-07-15 QwQ-32B-Preview · 65.2 · 2024-11-28 o3 · 87.7 · 2024-12-20 o3 · 87.7 · 2026-03-25 Grok 3 (Think) · 84.6 · 2025-02-19 Claude 3.7 Sonnet · 84.8 · 2025-02-24 Claude 3.7 Sonnet · 84.8 · 2025-02-26 OpenAI o3-mini · 78 · 2025-02-26 Grok 3 Beta · 84.6 · 2025-02-26 DeepSeek R1 · 71.5 · 2025-02-26 GPT-4.5 · 71.4 · 2025-03-05 Grok 3 · 84.6 · 2025-03-11 DeepSeek-V3-0324 · 68.4 · 2025-03-24 Gemini 2.5 Pro (experimental) · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-26 Gemini 2.5 Pro · 84 · 2025-04-05 Seed1.5-Thinking · 77.3 · 2025-04-10 GPT‑4.1 nano · 50.3 · 2025-04-14 Gemini 2.0 Flash · 60.1 · 2025-04-15 Claude Sonnet 4 · 70 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Deepseek-R1-0528 · 81 · 2025-05-30 Kimi K2 · 75.1 · 2025-07-28 Kimi K2 · 75.1 · 2025-07-28 GPT-5 pro · 88.4 · 2025-08-07 GPT-5 pro · 89.4 · 2025-08-07 GPT-5 Pro · 88.4 · 2025-08-07 DeepSeek-V3.1-Terminus · 74.2 · 2025-09-22 Claude Sonnet 4.5 · 83.4 · 2025-09-30 Claude 3 Opus · 60 · 2025-10-24 O1 · 77 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2026-02-05 Gemini 3 Pro · 91.9 · 2025-10-24 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 93 · 2025-12-04 GPT-5.2 · 92.4 · 2025-10-24 Gemini 3.1 Pro Preview · 94.1 · 2025-10-24 Aristotle-X1 · 92.4 · 2025-10-24 GPT-4 · 39 · 2025-10-24 Gemini 3 Deep Think · 93.8 · 2025-11-18 Gemini 3 Deep Think · 93.8 · 2025-11-18 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 Kimi K2.5 · 87.6 · 2026-01-27 Grok 4 · 87.7 · 2026-02-25 GPT-Live-1 · 84.2 · 2026-07-17 Kimi K3 · 93.5 · 2026-07-17 Inkling-Small · 89.5 · 2026-08-03 Qwen3.8-Max · 92.6 · 2026-08-03 Grok 4.6 · 94.9 · 2026-08-21 QAH model (GPT-OSS 120B compressed to 60B, MXFP4) · 67.4 · 2026-08-25 GLM-5.3 · 91.7 · 2026-08-28 K2-Horizon-375B-A23B · 87.3 · 2026-09-07 DeepSeek-V4.1-Flash · 90.9 · 2026-09-10 GPT-6 Astra · 96.3 · 2026-09-11 VeriLoop E2 · 93.9 · 2026-09-25 Qwen3.8-Flash-Next (IQ3_XXS) · 91.4 · 2026-09-29 OpenAI o3 · 87.7 · 2025-04-16
GPT-4 based baseline Claude 3.5 Sonnet Qwen2-72B QwQ-32B-Preview o3 Grok 3 (Think) Claude 3.7 Sonnet OpenAI o3-mini Grok 3 Beta DeepSeek R1 GPT-4.5 Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Seed1.5-Thinking GPT‑4.1 nano Gemini 2.0 Flash Claude Sonnet 4 Claude Opus 4 Deepseek-R1-0528 Kimi K2 GPT-5 pro GPT-5 Pro DeepSeek-V3.1-Terminus Claude Sonnet 4.5 Claude 3 Opus O1 Claude Opus 4.6 Gemini 3 Pro GPT-5.2 Gemini 3.1 Pro Preview Aristotle-X1 GPT-4 Gemini 3 Deep Think GPT-5.2 Thinking GPT-5.2 Pro Kimi K2.5 Grok 4 GPT-Live-1 Kimi K3 Inkling-Small Qwen3.8-Max Grok 4.6 QAH model (GPT-OSS 120B compressed to 60B, MXFP4) GLM-5.3 K2-Horizon-375B-A23B DeepSeek-V4.1-Flash GPT-6 Astra VeriLoop E2 Qwen3.8-Flash-Next (IQ3_XXS) OpenAI o3
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-09-29 Qwen3.8-Flash-Next (IQ3_XXS) 91.41% ISTA ने Qwen3.8-Flash-Next और 50% विशेषज्ञ-कटाई वाले कोडर बिल्ड के लिए GSQ-RCO GGUF जारी किए
2026-09-25 VeriLoop E2 93.94% VeriLoop E2: BF16 से IQ1_M तक GGUF सीढ़ी के साथ 27B पोस्ट-ट्रेन्ड मॉडल
2026-09-11 GPT-6 Astra 96.3% OpenAI ने GPT-6 Astra लॉन्च किया, कम लागत के साथ लीडरबोर्ड में शीर्ष स्थान हासिल किया
2026-09-10 DeepSeek-V4.1-Flash 90.9% DeepSeek ने मूल बहुआयामी समर्थन के साथ V4.1-Flash मॉडल जारी किया
2026-09-07 K2-Horizon-375B-A23B 87.3% IFM ने K2 Horizon जारी किया: 0.9B से 375B तक के छह Apache 2.0 मॉडल
2026-08-28 GLM-5.3 91.72% साइबर सुरक्षा लाभों के लिए Z.ai ने GLM-5.3 को फाइन-ट्यून किया
2026-08-25 QAH model (GPT-OSS 120B compressed to 60B, MXFP4) 67.4% मल्टीवर्स कंप्यूटिंग का QAH 4-बिट GPT-OSS को इसके पूर्ण-प्रीसिजन मूल से बेहतर प्रदर्शन करने में सक्षम बनाता है
2026-08-21 Grok 4.6 94.9% SpaceXAI ने एजेंटिक कार्य के लिए Cursor डेटा के साथ Grok 4.6 पेश किया
2026-08-03 Qwen3.8-Max 92.6% अलibaba ने 2.4T-पैरामीटर MoE मॉडल Qwen3.8-Max जारी किया
2026-08-03 Inkling-Small 89.5% थिंकिंग मशीन्स लैब ने 276B ओपन वेट्स मल्टीमोडल MoE मॉडल इंकलिंग-स्माल रिलीज़ किया
2026-07-17 Kimi K3 93.5% Moonshot AI ने 1M संदर्भ के साथ 2.8T-पैरामीटर MoE मॉडल Kimi K3 को ओपन किया
2026-07-17 GPT-Live-1 84.2% OpenAI ने फुल-डप्लेक्स वॉइस मॉडल्स जारी किए और जर्मन अदालत ने Google को AI ओवरव्यू के लिए जिम्मेदार ठहराया
2026-03-25 o3 87.7% OpenAI ने ChatGPT से o3 को निष्क्रिय करने की घोषणा की और बेंचमार्क स्कोर साझा किए
2026-02-25 Grok 4 87.7% xAI ने मजबूत एजेंटिक और कोडिंग बेंचमार्क्स के साथ Grok 4 तर्क मॉडल जारी किया
2026-02-05 Claude Opus 4.6 91.3% Anthropic ने Claude Opus 4.6 जारी की, जिसमें 1M संदर्भ खिड़की और एजेंटिक सुधार शामिल हैं
2026-01-27 Kimi K2.5 87.6% Moonshot ने Agent Swarm तकनीक के साथ Kimi K2.5 जारी किया
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI ने विज्ञान और गणित के लिए GPT-5.2 Pro और Thinking मॉडल जारी किए
2025-12-11 GPT-5.2 Pro 93.2% OpenAI ने कोडिंग, लंबे-संदर्भ और तर्क क्षमताओं में सुधार के साथ GPT-5.2 पेश किया
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI ने कोडिंग, लंबे-संदर्भ और तर्क क्षमताओं में सुधार के साथ GPT-5.2 पेश किया
2025-12-11 GPT-5.2 Pro 93.2% OpenAI ने विज्ञान और गणित के लिए GPT-5.2 Pro और Thinking मॉडल जारी किए
2025-12-04 Gemini 3 Pro 93.0% Epoch AI ने Frontier Data Centers Hub लॉन्च किया और OSWorld benchmark का विश्लेषण किया
2025-11-18 Gemini 3 Deep Think 93.8% Google ने शीर्ष तर्क और बहुआयामी क्षमताओं के साथ Gemini 3 Pro जारी किया
2025-11-18 Gemini 3 Pro 91.9% Google ने शीर्ष तर्क और बहुआयामी क्षमताओं के साथ Gemini 3 Pro जारी किया
2025-11-18 Gemini 3 Pro 91.9% Google ने Gemini 3 Pro को अत्याधुनिक तर्क और बहु-मोडल क्षमताओं के साथ जारी किया
2025-11-18 Gemini 3 Deep Think 93.8% Google ने Gemini 3 Pro को अत्याधुनिक तर्क और बहु-मोडल क्षमताओं के साथ जारी किया
2025-10-24 Claude 3 Opus 60.0% GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
2025-10-24 O1 77.0% GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
2025-10-24 Claude Opus 4.6 91.3% GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
2025-10-24 Gemini 3 Pro 91.9% GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
2025-10-24 GPT-5.2 92.4% GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
2025-10-24 Gemini 3.1 Pro Preview 94.1% GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
2025-10-24 Aristotle-X1 92.4% GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
2025-10-24 GPT-4 39.0% GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
2025-09-30 Claude Sonnet 4.5 83.4% Anthropic ने कोडिंग और एजेंट क्षमताओं में सुधार के साथ Claude Sonnet 4.5 जारी किया
2025-09-22 DeepSeek-V3.1-Terminus 74.24% DeepSeek ने DeepSeek-V3.1-Terminus को भाषा और एजेंट सुधारों के साथ जारी किया
2025-08-07 GPT-5 pro 88.4% OpenAI ने एकत्रीकृत रूटिंग और विशेषज्ञ-स्तरीय तर्क के साथ GPT-5 पेश किया
2025-08-07 GPT-5 pro 89.4% OpenAI ने रियल-टाइम राउटिंग और मुफ्त एक्सेस के साथ एकत्रीकृत GPT-5 लॉन्च किया
2025-08-07 GPT-5 Pro 88.4% ओपनएआई ने अनुकूलित तर्कशक्ति और एकीकृत वास्तुकला के साथ GPT-5 लॉन्च किया
2025-07-28 Kimi K2 75.1% Kimi K2: 1T पैरामीटर और MuonClip ऑप्टिमाइज़र के साथ ओपन MoE मॉडल
2025-07-28 Kimi K2 75.1% Moonshot ने Kimi K2 जारी किया, जो 32B सक्रिय पैरामीटर के साथ एक ओपन एजेंटिक MoE मॉडल है
2025-05-30 Deepseek-R1-0528 81.0% DeepSeek ने R1 मॉडल को बेहतर तर्कशक्ति और बेंचमार्क स्कोर के साथ अपडेट किया
2025-05-22 Claude Sonnet 4 70.0% एन्थ्रोपिक ने क्लॉड ओपस 4 और सनेट 4 को विस्तृत चिंतन और टूल उपयोग के साथ पेश किया
2025-05-22 Claude Opus 4 74.9% एन्थ्रोपिक ने क्लॉड ओपस 4 और सनेट 4 को विस्तृत चिंतन और टूल उपयोग के साथ पेश किया
2025-05-22 Claude Opus 4 74.9% Anthropic ने Claude Opus 4 और Sonnet 4 को ASL-3 सुरक्षा उपायों के साथ जारी किया
2025-04-16 OpenAI o3 87.7% OpenAI
2025-04-15 Gemini 2.0 Flash 60.1% गूगल ने गेमिनी 1.5 प्रो की तुलना में दोगुनी गति और बढ़े हुए गुणवत्ता के साथ गेमिनी 2.0 फ्लैश जारी किया
2025-04-14 GPT‑4.1 nano 50.3% OpenAI ने API में GPT-4.1, GPT-4.1 mini और GPT-4.1 nano लॉन्च किए
2025-04-10 Seed1.5-Thinking 77.3% Seed1.5-Thinking तर्क को बेहतर बनाने के लिए रीइन्फोर्समेंट लर्निंग का उपयोग करता है
2025-04-05 Gemini 2.5 Pro 84.0% मजबूत बेंचमार्क परिणामों के बीच गूगल ने जेमिनी 2.5 प्रो तक पहुंच का विस्तार किया
2025-03-26 Gemini 2.5 Pro 84.0% गूगल ने 1M टोकन संदर्भ के साथ एक्सपेरिमेंटल जेमिनी 2.5 प्रो रीजनिंग मॉडल जारी किया
2025-03-25 Gemini 2.5 Pro (experimental) 84.0% Google DeepMind ने Gemini 2.5 Pro एक्सपेरिमेंटल मॉडल जारी किया
2025-03-25 Gemini 2.5 Pro 84.0% Google DeepMind
2025-03-24 DeepSeek-V3-0324 68.4% DeepSeek-V3-0324 ने DeepSeek-V3 की तुलना में तर्कशक्ति, कोडिंग और चीनी लेखन में सुधार किया है
2025-03-11 Grok 3 84.6% xAI ने गहरा तर्क और मिलियन-टोकन संदर्भ के साथ Grok 3 जारी किया
2025-03-05 GPT-4.5 71.4% OpenAI ने ChatGPT Plus के लिए अपना सबसे बड़ा मॉडल GPT-4.5 जारी किया
2025-02-26 OpenAI o3-mini 78.0% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-26 Grok 3 Beta 84.6% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-26 DeepSeek R1 71.5% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-26 Claude 3.5 Sonnet 65.0% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-26 Claude 3.7 Sonnet 84.8% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-24 Claude 3.7 Sonnet 84.8% Anthropic ने Claude 3.7 Sonnet को गतिशील तर्क नियंत्रण के साथ जारी किया
2025-02-19 Grok 3 (Think) 84.6% xAI ने Grok 3 बीटा और DeepSearch एजेंट जारी किया
2024-12-20 o3 87.7% OpenAI ने तर्क और कोडिंग में उच्च प्रदर्शन के साथ o3 मॉडल जारी किया
2024-11-28 QwQ-32B-Preview 65.2% Qwen ने QwQ-32B-Preview जारी किया, एक प्रायोगिक तर्कशील मॉडल
2024-07-15 Qwen2-72B 37.9% Qwen टीम ने 72B डेंस और MoE मॉडल के साथ Qwen2 सीरीज जारी की
2024-07-15 Qwen2-72B 37.9% Qwen2 तकनीकी रिपोर्ट में 72B तक घन और MoE मॉडल पेश किए गए
2024-06-20 Claude 3.5 Sonnet 59.4% एन्थ्रोपिक ने क्लॉड 3.5 सॉनेट के लिए कोडिंग और विज़न बेंचमार्क में सुधार के साथ एक एडेन्डम जारी किया
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic
2023-11-20 GPT-4 based baseline 39.0% GPQA: एक ग्रेजुएट-स्तर का Google-प्रूफ Q&A बेंचमार्क