Benchmark · reasoning

GPQA Diamond

61 परिणाम 44 मॉडल

GPQA Diamond, GPQA का सबसे कठिन उपसमूह है — विशेषज्ञों द्वारा लिखे गए स्नातकोत्तर स्तर के और "Google-प्रूफ़" बहुविकल्पीय विज्ञान प्रश्नों (जीवविज्ञान, भौतिकी, रसायन) का संग्रह। मॉडल का मूल्यांकन सही उत्तर चुनने की प्रतिशत सटीकता से होता है।

और पढ़ें
उदाहरण
एक सामान्य प्रश्न स्नातकोत्तर-स्तरीय तर्क माँगने वाला कठिन बहुविकल्पीय प्रश्न होता है; उदाहरण के लिए, एक रसायन विज्ञान का प्रश्न जो किसी अभिक्रिया-तंत्र का वर्णन करता है और पूछता है कि चार विकल्पों में से कौन-सा सही उत्पाद देता है, इतना कठिन कि गैर-विशेषज्ञ वेब सर्च से भी हल नहीं कर पाता।
स्कोरिंग
स्कोर सही उत्तर दिए गए प्रश्नों का प्रतिशत (सटीकता) है: जिन प्रश्नों में मॉडल सही विकल्प चुनता है उनकी संख्या को कुल प्रश्नों की संख्या से भाग देकर।
सत्यापन
हर उत्तर को एकमात्र ज्ञात सही विकल्प से सटीक मिलान द्वारा स्वचालित रूप से जाँचा जाता है, इसलिए किसी मानवीय निर्णय की आवश्यकता नहीं; "Diamond" का लेबल डेटासेट बनाते समय ही दिया गया था — जब योग्य विशेषज्ञ उत्तर पर सहमत हुए और गैर-विशेषज्ञ फिर भी गलत रहे।
यह क्यों मायने रखता है
यह असली विशेषज्ञ-स्तरीय वैज्ञानिक तर्क (न कि खोजे जा सकने वाले तथ्यों) की सबसे कठिन परीक्षाओं में से एक है, इसलिए GPQA Diamond पर ऊँचा स्कोर इस बात का प्रमुख संकेत है कि कोई अग्रणी मॉडल कठिन, विशिष्ट समस्याओं पर तर्क कर सकता है।
हल किया गया उदाहरण
कार्य
एक इलेक्ट्रॉन (बिना सामान्यीकृत) स्पिन अवस्था (3i, 4)ᵀ में है। y-अक्ष के अनुदिश उसके स्पिन S_y का अपेक्षित मान ज्ञात कीजिए। विकल्प: (A) 12ħ/25 (B) −12ħ/25 (C) 25ħ/2 (D) −25ħ/2।
समाधान
Norm: |3i|²+|4|²=25. σ_y=[[0,−i],[i,0]]. ⟨S_y⟩=(ħ/2)·(ψ†σ_yψ)/(ψ†ψ)=(ħ/2)·(−24/25)=−12ħ/25 → (B).
व्याख्या
⟨S_y⟩ = ψ†S_yψ / ψ†ψ और S_y = (ħ/2)σ_y का उपयोग करने पर अंश ψ†σ_yψ = −24 तथा मान ψ†ψ = 25 मिलता है, जिससे −12ħ/25 (विकल्प B) प्राप्त होता है। GPQA चुने गए अक्षर का सही उत्तर से पूर्ण मिलान करके अंक देता है।
0 25 50 75 100 2023-11-20 2025-03-27 2026-08-03 GPT-4 based baseline · 39 · 2023-11-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 65 · 2025-02-26 Qwen2-72B · 37.9 · 2024-07-15 Qwen2-72B · 37.9 · 2024-07-15 QwQ-32B-Preview · 65.2 · 2024-11-28 o3 · 87.7 · 2024-12-20 o3 · 87.7 · 2026-03-25 Grok 3 (Think) · 84.6 · 2025-02-19 Claude 3.7 Sonnet · 84.8 · 2025-02-24 Claude 3.7 Sonnet · 84.8 · 2025-02-26 Grok 3 Beta · 84.6 · 2025-02-26 DeepSeek R1 · 71.5 · 2025-02-26 OpenAI o3-mini · 78 · 2025-02-26 GPT-4.5 · 71.4 · 2025-03-05 Grok 3 · 84.6 · 2025-03-11 DeepSeek-V3-0324 · 68.4 · 2025-03-24 Gemini 2.5 Pro (experimental) · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-26 Gemini 2.5 Pro · 84 · 2025-04-05 Seed1.5-Thinking · 77.3 · 2025-04-10 GPT‑4.1 nano · 50.3 · 2025-04-14 Gemini 2.0 Flash · 60.1 · 2025-04-15 Claude Sonnet 4 · 70 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Deepseek-R1-0528 · 81 · 2025-05-30 Kimi K2 · 75.1 · 2025-07-28 Kimi K2 · 75.1 · 2025-07-28 GPT-5 pro · 88.4 · 2025-08-07 GPT-5 pro · 89.4 · 2025-08-07 GPT-5 Pro · 88.4 · 2025-08-07 DeepSeek-V3.1-Terminus · 74.2 · 2025-09-22 Claude Sonnet 4.5 · 83.4 · 2025-09-30 GPT-5.2 · 92.4 · 2025-10-24 GPT-4 · 39 · 2025-10-24 Claude 3 Opus · 60 · 2025-10-24 O1 · 77 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2026-02-05 Gemini 3 Pro · 91.9 · 2025-10-24 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 93 · 2025-12-04 Gemini 3.1 Pro Preview · 94.1 · 2025-10-24 Aristotle-X1 · 92.4 · 2025-10-24 Gemini 3 Deep Think · 93.8 · 2025-11-18 Gemini 3 Deep Think · 93.8 · 2025-11-18 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 Kimi K2.5 · 87.6 · 2026-01-27 Grok 4 · 87.7 · 2026-02-25 GPT-Live-1 · 84.2 · 2026-07-17 Kimi K3 · 93.5 · 2026-07-17 Inkling-Small · 89.5 · 2026-08-03 Qwen3.8-Max · 92.6 · 2026-08-03 OpenAI o3 · 87.7 · 2025-04-16
GPT-4 based baseline Claude 3.5 Sonnet Qwen2-72B QwQ-32B-Preview o3 Grok 3 (Think) Claude 3.7 Sonnet Grok 3 Beta DeepSeek R1 OpenAI o3-mini GPT-4.5 Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Seed1.5-Thinking GPT‑4.1 nano Gemini 2.0 Flash Claude Sonnet 4 Claude Opus 4 Deepseek-R1-0528 Kimi K2 GPT-5 pro GPT-5 Pro DeepSeek-V3.1-Terminus Claude Sonnet 4.5 GPT-5.2 GPT-4 Claude 3 Opus O1 Claude Opus 4.6 Gemini 3 Pro Gemini 3.1 Pro Preview Aristotle-X1 Gemini 3 Deep Think GPT-5.2 Thinking GPT-5.2 Pro Kimi K2.5 Grok 4 GPT-Live-1 Kimi K3 Inkling-Small Qwen3.8-Max OpenAI o3
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-08-03 Qwen3.8-Max 92.6% अलibaba ने 2.4T-पैरामीटर MoE मॉडल Qwen3.8-Max जारी किया
2026-08-03 Inkling-Small 89.5% थिंकिंग मशीन्स लैब ने 276B ओपन वेट्स मल्टीमोडल MoE मॉडल इंकलिंग-स्माल रिलीज़ किया
2026-07-17 Kimi K3 93.5% Moonshot AI ने 1M संदर्भ के साथ 2.8T-पैरामीटर MoE मॉडल Kimi K3 को ओपन किया
2026-07-17 GPT-Live-1 84.2% OpenAI ने फुल-डप्लेक्स वॉइस मॉडल्स जारी किए और जर्मन अदालत ने Google को AI ओवरव्यू के लिए जिम्मेदार ठहराया
2026-03-25 o3 87.7% OpenAI ने ChatGPT से o3 को निष्क्रिय करने की घोषणा की और बेंचमार्क स्कोर साझा किए
2026-02-25 Grok 4 87.7% xAI ने मजबूत एजेंटिक और कोडिंग बेंचमार्क्स के साथ Grok 4 तर्क मॉडल जारी किया
2026-02-05 Claude Opus 4.6 91.3% Anthropic ने Claude Opus 4.6 जारी की, जिसमें 1M संदर्भ खिड़की और एजेंटिक सुधार शामिल हैं
2026-01-27 Kimi K2.5 87.6% Moonshot ने Agent Swarm तकनीक के साथ Kimi K2.5 जारी किया
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI ने कोडिंग, लंबे-संदर्भ और तर्क क्षमताओं में सुधार के साथ GPT-5.2 पेश किया
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI ने विज्ञान और गणित के लिए GPT-5.2 Pro और Thinking मॉडल जारी किए
2025-12-11 GPT-5.2 Pro 93.2% OpenAI ने विज्ञान और गणित के लिए GPT-5.2 Pro और Thinking मॉडल जारी किए
2025-12-11 GPT-5.2 Pro 93.2% OpenAI ने कोडिंग, लंबे-संदर्भ और तर्क क्षमताओं में सुधार के साथ GPT-5.2 पेश किया
2025-12-04 Gemini 3 Pro 93.0% Epoch AI ने Frontier Data Centers Hub लॉन्च किया और OSWorld benchmark का विश्लेषण किया
2025-11-18 Gemini 3 Pro 91.9% Google ने शीर्ष तर्क और बहुआयामी क्षमताओं के साथ Gemini 3 Pro जारी किया
2025-11-18 Gemini 3 Deep Think 93.8% Google ने शीर्ष तर्क और बहुआयामी क्षमताओं के साथ Gemini 3 Pro जारी किया
2025-11-18 Gemini 3 Pro 91.9% Google ने Gemini 3 Pro को अत्याधुनिक तर्क और बहु-मोडल क्षमताओं के साथ जारी किया
2025-11-18 Gemini 3 Deep Think 93.8% Google ने Gemini 3 Pro को अत्याधुनिक तर्क और बहु-मोडल क्षमताओं के साथ जारी किया
2025-10-24 GPT-5.2 92.4% GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
2025-10-24 GPT-4 39.0% GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
2025-10-24 Claude 3 Opus 60.0% GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
2025-10-24 O1 77.0% GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
2025-10-24 Claude Opus 4.6 91.3% GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
2025-10-24 Gemini 3 Pro 91.9% GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
2025-10-24 Gemini 3.1 Pro Preview 94.1% GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
2025-10-24 Aristotle-X1 92.4% GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
2025-09-30 Claude Sonnet 4.5 83.4% Anthropic ने कोडिंग और एजेंट क्षमताओं में सुधार के साथ Claude Sonnet 4.5 जारी किया
2025-09-22 DeepSeek-V3.1-Terminus 74.24% DeepSeek ने DeepSeek-V3.1-Terminus को भाषा और एजेंट सुधारों के साथ जारी किया
2025-08-07 GPT-5 pro 88.4% OpenAI ने एकत्रीकृत रूटिंग और विशेषज्ञ-स्तरीय तर्क के साथ GPT-5 पेश किया
2025-08-07 GPT-5 Pro 88.4% ओपनएआई ने अनुकूलित तर्कशक्ति और एकीकृत वास्तुकला के साथ GPT-5 लॉन्च किया
2025-08-07 GPT-5 pro 89.4% OpenAI ने रियल-टाइम राउटिंग और मुफ्त एक्सेस के साथ एकत्रीकृत GPT-5 लॉन्च किया
2025-07-28 Kimi K2 75.1% Kimi K2: 1T पैरामीटर और MuonClip ऑप्टिमाइज़र के साथ ओपन MoE मॉडल
2025-07-28 Kimi K2 75.1% Moonshot ने Kimi K2 जारी किया, जो 32B सक्रिय पैरामीटर के साथ एक ओपन एजेंटिक MoE मॉडल है
2025-05-30 Deepseek-R1-0528 81.0% DeepSeek ने R1 मॉडल को बेहतर तर्कशक्ति और बेंचमार्क स्कोर के साथ अपडेट किया
2025-05-22 Claude Sonnet 4 70.0% एन्थ्रोपिक ने क्लॉड ओपस 4 और सनेट 4 को विस्तृत चिंतन और टूल उपयोग के साथ पेश किया
2025-05-22 Claude Opus 4 74.9% Anthropic ने Claude Opus 4 और Sonnet 4 को ASL-3 सुरक्षा उपायों के साथ जारी किया
2025-05-22 Claude Opus 4 74.9% एन्थ्रोपिक ने क्लॉड ओपस 4 और सनेट 4 को विस्तृत चिंतन और टूल उपयोग के साथ पेश किया
2025-04-16 OpenAI o3 87.7% OpenAI
2025-04-15 Gemini 2.0 Flash 60.1% गूगल ने गेमिनी 1.5 प्रो की तुलना में दोगुनी गति और बढ़े हुए गुणवत्ता के साथ गेमिनी 2.0 फ्लैश जारी किया
2025-04-14 GPT‑4.1 nano 50.3% OpenAI ने API में GPT-4.1, GPT-4.1 mini और GPT-4.1 nano लॉन्च किए
2025-04-10 Seed1.5-Thinking 77.3% Seed1.5-Thinking तर्क को बेहतर बनाने के लिए रीइन्फोर्समेंट लर्निंग का उपयोग करता है
2025-04-05 Gemini 2.5 Pro 84.0% मजबूत बेंचमार्क परिणामों के बीच गूगल ने जेमिनी 2.5 प्रो तक पहुंच का विस्तार किया
2025-03-26 Gemini 2.5 Pro 84.0% गूगल ने 1M टोकन संदर्भ के साथ एक्सपेरिमेंटल जेमिनी 2.5 प्रो रीजनिंग मॉडल जारी किया
2025-03-25 Gemini 2.5 Pro (experimental) 84.0% Google DeepMind ने Gemini 2.5 Pro एक्सपेरिमेंटल मॉडल जारी किया
2025-03-25 Gemini 2.5 Pro 84.0% Google DeepMind
2025-03-24 DeepSeek-V3-0324 68.4% DeepSeek-V3-0324 ने DeepSeek-V3 की तुलना में तर्कशक्ति, कोडिंग और चीनी लेखन में सुधार किया है
2025-03-11 Grok 3 84.6% xAI ने गहरा तर्क और मिलियन-टोकन संदर्भ के साथ Grok 3 जारी किया
2025-03-05 GPT-4.5 71.4% OpenAI ने ChatGPT Plus के लिए अपना सबसे बड़ा मॉडल GPT-4.5 जारी किया
2025-02-26 Claude 3.7 Sonnet 84.8% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-26 Grok 3 Beta 84.6% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-26 DeepSeek R1 71.5% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-26 OpenAI o3-mini 78.0% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-26 Claude 3.5 Sonnet 65.0% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-24 Claude 3.7 Sonnet 84.8% Anthropic ने Claude 3.7 Sonnet को गतिशील तर्क नियंत्रण के साथ जारी किया
2025-02-19 Grok 3 (Think) 84.6% xAI ने Grok 3 बीटा और DeepSearch एजेंट जारी किया
2024-12-20 o3 87.7% OpenAI ने तर्क और कोडिंग में उच्च प्रदर्शन के साथ o3 मॉडल जारी किया
2024-11-28 QwQ-32B-Preview 65.2% Qwen ने QwQ-32B-Preview जारी किया, एक प्रायोगिक तर्कशील मॉडल
2024-07-15 Qwen2-72B 37.9% Qwen टीम ने 72B डेंस और MoE मॉडल के साथ Qwen2 सीरीज जारी की
2024-07-15 Qwen2-72B 37.9% Qwen2 तकनीकी रिपोर्ट में 72B तक घन और MoE मॉडल पेश किए गए
2024-06-20 Claude 3.5 Sonnet 59.4% एन्थ्रोपिक ने क्लॉड 3.5 सॉनेट के लिए कोडिंग और विज़न बेंचमार्क में सुधार के साथ एक एडेन्डम जारी किया
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic
2023-11-20 GPT-4 based baseline 39.0% GPQA: एक ग्रेजुएट-स्तर का Google-प्रूफ Q&A बेंचमार्क