Benchmark · reasoning

GPQA Diamond

61 نتائج 44 نماذج

GPQA Diamond هو أصعب مجموعة فرعية من GPQA، وهو مجموعة من أسئلة الاختيار من متعدد بمستوى الدراسات العليا و«عصيّة على Google» في الأحياء والفيزياء والكيمياء كتبها خبراء. ويُقيَّم النموذج بنسبة دقّته المئوية في اختيار الإجابة الصحيحة.

اقرأ المزيد
مثال
السؤال النموذجي هو سؤال اختيار من متعدد صعب يتطلب استدلالاً بمستوى الدراسات العليا؛ مثلاً سؤال كيمياء يصف آلية تفاعل ويسأل أيّ من الخيارات الأربعة يعطي الناتج الصحيح، صعب لدرجة أنّ غير المتخصص لا يحلّه حتى بالبحث على الويب.
طريقة التقييم
الدرجة هي نسبة الأسئلة المُجابة بشكل صحيح (الدقّة): عدد الأسئلة التي يختار فيها النموذج الخيار الصحيح مقسوماً على إجمالي عدد الأسئلة.
التحقق
تُصحَّح كل إجابة آلياً بالمطابقة التامة مع الخيار الصحيح الوحيد المعروف، فلا حاجة إلى حكم بشري؛ أمّا وسم «Diamond» نفسه فقد مُنح عند إنشاء مجموعة البيانات، حين اتفق الخبراء المؤهلون على الإجابة وأخطأ غير المتخصصين رغم ذلك.
لماذا يهم
إنه من أصعب اختبارات الاستدلال العلمي الحقيقي بمستوى الخبراء (لا المعلومات التي يمكن البحث عنها)، لذا فإن الحصول على درجة عالية في GPQA Diamond إشارة بارزة إلى قدرة النموذج المتقدّم على الاستدلال في المسائل الصعبة والمتخصصة.
مثال محلول
المهمة
إلكترون في حالة سبين (غير مُطبَّعة) (3i, 4)ᵀ. أوجد القيمة المتوقعة لسبينه على طول المحور y، أي S_y. الخيارات: (A) 12ħ/25 (B) −12ħ/25 (C) 25ħ/2 (D) −25ħ/2.
الحل
Norm: |3i|²+|4|²=25. σ_y=[[0,−i],[i,0]]. ⟨S_y⟩=(ħ/2)·(ψ†σ_yψ)/(ψ†ψ)=(ħ/2)·(−24/25)=−12ħ/25 → (B).
الشرح
باستخدام ⟨S_y⟩ = ψ†S_yψ / ψ†ψ مع S_y = (ħ/2)σ_y، يكون البسط ψ†σ_yψ = −24 والمعيار ψ†ψ = 25، ما يعطي −12ħ/25 (الخيار B). يقيّم GPQA وفق التطابق التام للحرف المختار مع الإجابة النموذجية.
0 25 50 75 100 2023-11-20 2025-03-27 2026-08-03 GPT-4 based baseline · 39 · 2023-11-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 65 · 2025-02-26 Qwen2-72B · 37.9 · 2024-07-15 Qwen2-72B · 37.9 · 2024-07-15 QwQ-32B-Preview · 65.2 · 2024-11-28 o3 · 87.7 · 2024-12-20 o3 · 87.7 · 2026-03-25 Grok 3 (Think) · 84.6 · 2025-02-19 Claude 3.7 Sonnet · 84.8 · 2025-02-24 Claude 3.7 Sonnet · 84.8 · 2025-02-26 Grok 3 Beta · 84.6 · 2025-02-26 DeepSeek R1 · 71.5 · 2025-02-26 OpenAI o3-mini · 78 · 2025-02-26 GPT-4.5 · 71.4 · 2025-03-05 Grok 3 · 84.6 · 2025-03-11 DeepSeek-V3-0324 · 68.4 · 2025-03-24 Gemini 2.5 Pro (experimental) · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-26 Gemini 2.5 Pro · 84 · 2025-04-05 Seed1.5-Thinking · 77.3 · 2025-04-10 GPT‑4.1 nano · 50.3 · 2025-04-14 Gemini 2.0 Flash · 60.1 · 2025-04-15 Claude Sonnet 4 · 70 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Deepseek-R1-0528 · 81 · 2025-05-30 Kimi K2 · 75.1 · 2025-07-28 Kimi K2 · 75.1 · 2025-07-28 GPT-5 pro · 88.4 · 2025-08-07 GPT-5 pro · 89.4 · 2025-08-07 GPT-5 Pro · 88.4 · 2025-08-07 DeepSeek-V3.1-Terminus · 74.2 · 2025-09-22 Claude Sonnet 4.5 · 83.4 · 2025-09-30 GPT-5.2 · 92.4 · 2025-10-24 GPT-4 · 39 · 2025-10-24 Claude 3 Opus · 60 · 2025-10-24 O1 · 77 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2026-02-05 Gemini 3 Pro · 91.9 · 2025-10-24 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 93 · 2025-12-04 Gemini 3.1 Pro Preview · 94.1 · 2025-10-24 Aristotle-X1 · 92.4 · 2025-10-24 Gemini 3 Deep Think · 93.8 · 2025-11-18 Gemini 3 Deep Think · 93.8 · 2025-11-18 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 Kimi K2.5 · 87.6 · 2026-01-27 Grok 4 · 87.7 · 2026-02-25 GPT-Live-1 · 84.2 · 2026-07-17 Kimi K3 · 93.5 · 2026-07-17 Inkling-Small · 89.5 · 2026-08-03 Qwen3.8-Max · 92.6 · 2026-08-03 OpenAI o3 · 87.7 · 2025-04-16
GPT-4 based baseline Claude 3.5 Sonnet Qwen2-72B QwQ-32B-Preview o3 Grok 3 (Think) Claude 3.7 Sonnet Grok 3 Beta DeepSeek R1 OpenAI o3-mini GPT-4.5 Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Seed1.5-Thinking GPT‑4.1 nano Gemini 2.0 Flash Claude Sonnet 4 Claude Opus 4 Deepseek-R1-0528 Kimi K2 GPT-5 pro GPT-5 Pro DeepSeek-V3.1-Terminus Claude Sonnet 4.5 GPT-5.2 GPT-4 Claude 3 Opus O1 Claude Opus 4.6 Gemini 3 Pro Gemini 3.1 Pro Preview Aristotle-X1 Gemini 3 Deep Think GPT-5.2 Thinking GPT-5.2 Pro Kimi K2.5 Grok 4 GPT-Live-1 Kimi K3 Inkling-Small Qwen3.8-Max OpenAI o3
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-08-03 Qwen3.8-Max 92.6% أليبايبا تطلق Qwen3.8-Max، نموذج MoE بـ 2.4 تريليون معلمة
2026-08-03 Inkling-Small 89.5% مختبر الآلات المفكرة يُصدر Inkling-Small، وهو نموذج MoE متعدد الوسائط بوزن مفتوح يتكون من 276 مليار معلمة
2026-07-17 Kimi K3 93.5% مونشوت آي إيه تطلق كيمي كي3، نموذج MoE مفتوح المصدر بـ 2.8 تريليون معلمة وسياق يصل إلى مليون رمز
2026-07-17 GPT-Live-1 84.2% OpenAI تطلق نماذج صوتية ثنائية الاتجاه ومحكمة ألمانية تحاسب جوجل على ملخصات الذكاء الاصطناعي
2026-03-25 o3 87.7% OpenAI تعلن عن تقاعد نموذج o3 من ChatGPT وتشارك نتائج الاختبارات المرجعية
2026-02-25 Grok 4 87.7% xAI تطلق نموذج Grok 4 للاستدلال بمعايير قوية للوكلاء والبرمجة
2026-02-05 Claude Opus 4.6 91.3% أنثروبيك تطلق كلاود أوبوس 4.6 بنافذة سياق بـ 1 مليون وتطبيقات عميلية محسّنة
2026-01-27 Kimi K2.5 87.6% مونشوت تطلق Kimi K2.5 بتقنية Agent Swarm
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI تطرح GPT-5.2 بقدرات محسّنة للبرمجة والسياق الطويل والاستدلال
2025-12-11 GPT-5.2 Thinking 92.4% أوبن إيه آي تطلق نماذج GPT-5.2 Pro وThinking للعلوم والرياضيات
2025-12-11 GPT-5.2 Pro 93.2% أوبن إيه آي تطلق نماذج GPT-5.2 Pro وThinking للعلوم والرياضيات
2025-12-11 GPT-5.2 Pro 93.2% OpenAI تطرح GPT-5.2 بقدرات محسّنة للبرمجة والسياق الطويل والاستدلال
2025-12-04 Gemini 3 Pro 93.0% Epoch AI تطلق مركز بيانات الحدود وتحلل معيار OSWorld
2025-11-18 Gemini 3 Pro 91.9% جوجل تطلق Gemini 3 Pro بقدرة reasoning متعددة الوسائط متقدمة
2025-11-18 Gemini 3 Deep Think 93.8% جوجل تطلق Gemini 3 Pro بقدرة reasoning متعددة الوسائط متقدمة
2025-11-18 Gemini 3 Pro 91.9% جوجل تطلق Gemini 3 Pro بقدرات استدلال متعددة الوسائط متقدمة
2025-11-18 Gemini 3 Deep Think 93.8% جوجل تطلق Gemini 3 Pro بقدرات استدلال متعددة الوسائط متقدمة
2025-10-24 GPT-5.2 92.4% معيار GPQA-Diamond: النتائج، لوحة المتصدرين ومقارنة نماذج الذكاء الاصطناعي
2025-10-24 GPT-4 39.0% معيار GPQA-Diamond: النتائج، لوحة المتصدرين ومقارنة نماذج الذكاء الاصطناعي
2025-10-24 Claude 3 Opus 60.0% معيار GPQA-Diamond: النتائج، لوحة المتصدرين ومقارنة نماذج الذكاء الاصطناعي
2025-10-24 O1 77.0% معيار GPQA-Diamond: النتائج، لوحة المتصدرين ومقارنة نماذج الذكاء الاصطناعي
2025-10-24 Claude Opus 4.6 91.3% معيار GPQA-Diamond: النتائج، لوحة المتصدرين ومقارنة نماذج الذكاء الاصطناعي
2025-10-24 Gemini 3 Pro 91.9% معيار GPQA-Diamond: النتائج، لوحة المتصدرين ومقارنة نماذج الذكاء الاصطناعي
2025-10-24 Gemini 3.1 Pro Preview 94.1% معيار GPQA-Diamond: النتائج، لوحة المتصدرين ومقارنة نماذج الذكاء الاصطناعي
2025-10-24 Aristotle-X1 92.4% معيار GPQA-Diamond: النتائج، لوحة المتصدرين ومقارنة نماذج الذكاء الاصطناعي
2025-09-30 Claude Sonnet 4.5 83.4% أنثروبيك تطلق كلود سونيت 4.5 بقدرات برمجة ووكيل محسّنة
2025-09-22 DeepSeek-V3.1-Terminus 74.24% ديب سيك تطلق نموذج DeepSeek-V3.1-Terminus مع إصلاحات للغة والوكيل
2025-08-07 GPT-5 pro 88.4% OpenAI تطرح GPT-5 بتوجيه موحد واستدلال على مستوى الخبراء
2025-08-07 GPT-5 Pro 88.4% أوبن إيه آي تطلق جي بي تي-5 بمنطق تكيفي وهندسة معمارية موحدة
2025-08-07 GPT-5 pro 89.4% OpenAI تطلق GPT-5 الموحّد مع التوجيه في الوقت الفعلي ووصول مجاني
2025-07-28 Kimi K2 75.1% كيمي K2: نموذج MoE مفتوح المصدر يحتوي على 1T معلمة ومُحسّن MuonClip
2025-07-28 Kimi K2 75.1% مونشوت تطلق Kimi K2، نموذج MoE مفتوح المصدر للوكلاء بـ 32 مليار معلمة نشطة
2025-05-30 Deepseek-R1-0528 81.0% ديب سيك تُحدّث نموذج R1 بتحسينات في الاستدلال ونتائج الاختبارات
2025-05-22 Claude Sonnet 4 70.0% أنثروبيك تطرح كلاود أوبس 4 وسونيت 4 مع التفكير الممتد واستخدام الأدوات
2025-05-22 Claude Opus 4 74.9% أنثروبيك تطلق كلاود أوبس 4 وسونيت 4 بتدابير سلامة ASL-3
2025-05-22 Claude Opus 4 74.9% أنثروبيك تطرح كلاود أوبس 4 وسونيت 4 مع التفكير الممتد واستخدام الأدوات
2025-04-16 OpenAI o3 87.7% OpenAI
2025-04-15 Gemini 2.0 Flash 60.1% جوجل تطلق Gemini 2.0 Flash بجودة محسّنة وسرعة ضعف سرعة Gemini 1.5 Pro
2025-04-14 GPT‑4.1 nano 50.3% OpenAI تُطلق GPT-4.1 وGPT-4.1 mini وGPT-4.1 nano عبر واجهة برمجة التطبيقات
2025-04-10 Seed1.5-Thinking 77.3% يستخدم Seed1.5-Thinking التعلم بالتعزيز لتحسين الاستدلال
2025-04-05 Gemini 2.5 Pro 84.0% جوجل توسع الوصول إلى Gemini 2.5 Pro وسط نتائج معيارية قوية
2025-03-26 Gemini 2.5 Pro 84.0% جوجل تطلق نموذج التفكير التجريبي Gemini 2.5 Pro بسياق يتكون من مليون رمز
2025-03-25 Gemini 2.5 Pro (experimental) 84.0% Google DeepMind تطلق نموذج Gemini 2.5 Pro التجريبي
2025-03-25 Gemini 2.5 Pro 84.0% Google DeepMind
2025-03-24 DeepSeek-V3-0324 68.4% DeepSeek-V3-0324 يحسّن الاستدلال والبرمجة والكتابة الصينية مقارنة بـ DeepSeek-V3
2025-03-11 Grok 3 84.6% xAI تطلق Grok 3 مع الاستدلال العميق وسياق مليون رمز
2025-03-05 GPT-4.5 71.4% OpenAI تطلق GPT-4.5، أكبر نموذج لها، لـ ChatGPT Plus
2025-02-26 Claude 3.7 Sonnet 84.8% مقارنة معايير التقييم بين Claude 3.7 Sonnet و o3-mini و R1 و Grok 3 Beta
2025-02-26 Grok 3 Beta 84.6% مقارنة معايير التقييم بين Claude 3.7 Sonnet و o3-mini و R1 و Grok 3 Beta
2025-02-26 DeepSeek R1 71.5% مقارنة معايير التقييم بين Claude 3.7 Sonnet و o3-mini و R1 و Grok 3 Beta
2025-02-26 OpenAI o3-mini 78.0% مقارنة معايير التقييم بين Claude 3.7 Sonnet و o3-mini و R1 و Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 65.0% مقارنة معايير التقييم بين Claude 3.7 Sonnet و o3-mini و R1 و Grok 3 Beta
2025-02-24 Claude 3.7 Sonnet 84.8% أنثروبيك تطلق كلاود 3.7 سونيت مع تحكم ديناميكي في التفكير
2025-02-19 Grok 3 (Think) 84.6% xAI تطلق النسخة التجريبية من Grok 3 ووكيل DeepSearch
2024-12-20 o3 87.7% OpenAI تطلق نموذج o3 بأداء عالٍ في الاستدلال والبرمجة
2024-11-28 QwQ-32B-Preview 65.2% Qwen تطلق QwQ-32B-Preview، نموذج استدلال تجريبي
2024-07-15 Qwen2-72B 37.9% فريق Qwen يُصدر سلسلة Qwen2 بنماذج كثيفة و MoE بحجم 72 مليار
2024-07-15 Qwen2-72B 37.9% تقرير Qwen2 التقني يقدم نماذج كثيفة ونماذج MoE تصل إلى 72 مليار معلمة
2024-06-20 Claude 3.5 Sonnet 59.4% أنثروبيك تطلق ملحقاً لـ Claude 3.5 Sonnet بمعايير محسّنة في البرمجة والرؤية
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic
2023-11-20 GPT-4 based baseline 39.0% GPQA: معيار أسئلة وأجوبة على مستوى الدراسات العليا ومقاوم لبحث Google