| 2026-08-03 |
Qwen3.8-Max |
92.6% |
أليبايبا تطلق Qwen3.8-Max، نموذج MoE بـ 2.4 تريليون معلمة
|
| 2026-08-03 |
Inkling-Small |
89.5% |
مختبر الآلات المفكرة يُصدر Inkling-Small، وهو نموذج MoE متعدد الوسائط بوزن مفتوح يتكون من 276 مليار معلمة
|
| 2026-07-17 |
Kimi K3 |
93.5% |
مونشوت آي إيه تطلق كيمي كي3، نموذج MoE مفتوح المصدر بـ 2.8 تريليون معلمة وسياق يصل إلى مليون رمز
|
| 2026-07-17 |
GPT-Live-1 |
84.2% |
OpenAI تطلق نماذج صوتية ثنائية الاتجاه ومحكمة ألمانية تحاسب جوجل على ملخصات الذكاء الاصطناعي
|
| 2026-03-25 |
o3 |
87.7% |
OpenAI تعلن عن تقاعد نموذج o3 من ChatGPT وتشارك نتائج الاختبارات المرجعية
|
| 2026-02-25 |
Grok 4 |
87.7% |
xAI تطلق نموذج Grok 4 للاستدلال بمعايير قوية للوكلاء والبرمجة
|
| 2026-02-05 |
Claude Opus 4.6 |
91.3% |
أنثروبيك تطلق كلاود أوبوس 4.6 بنافذة سياق بـ 1 مليون وتطبيقات عميلية محسّنة
|
| 2026-01-27 |
Kimi K2.5 |
87.6% |
مونشوت تطلق Kimi K2.5 بتقنية Agent Swarm
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI تطرح GPT-5.2 بقدرات محسّنة للبرمجة والسياق الطويل والاستدلال
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
أوبن إيه آي تطلق نماذج GPT-5.2 Pro وThinking للعلوم والرياضيات
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
أوبن إيه آي تطلق نماذج GPT-5.2 Pro وThinking للعلوم والرياضيات
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI تطرح GPT-5.2 بقدرات محسّنة للبرمجة والسياق الطويل والاستدلال
|
| 2025-12-04 |
Gemini 3 Pro |
93.0% |
Epoch AI تطلق مركز بيانات الحدود وتحلل معيار OSWorld
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
جوجل تطلق Gemini 3 Pro بقدرة reasoning متعددة الوسائط متقدمة
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
جوجل تطلق Gemini 3 Pro بقدرة reasoning متعددة الوسائط متقدمة
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
جوجل تطلق Gemini 3 Pro بقدرات استدلال متعددة الوسائط متقدمة
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
جوجل تطلق Gemini 3 Pro بقدرات استدلال متعددة الوسائط متقدمة
|
| 2025-10-24 |
GPT-5.2 |
92.4% |
معيار GPQA-Diamond: النتائج، لوحة المتصدرين ومقارنة نماذج الذكاء الاصطناعي
|
| 2025-10-24 |
GPT-4 |
39.0% |
معيار GPQA-Diamond: النتائج، لوحة المتصدرين ومقارنة نماذج الذكاء الاصطناعي
|
| 2025-10-24 |
Claude 3 Opus |
60.0% |
معيار GPQA-Diamond: النتائج، لوحة المتصدرين ومقارنة نماذج الذكاء الاصطناعي
|
| 2025-10-24 |
O1 |
77.0% |
معيار GPQA-Diamond: النتائج، لوحة المتصدرين ومقارنة نماذج الذكاء الاصطناعي
|
| 2025-10-24 |
Claude Opus 4.6 |
91.3% |
معيار GPQA-Diamond: النتائج، لوحة المتصدرين ومقارنة نماذج الذكاء الاصطناعي
|
| 2025-10-24 |
Gemini 3 Pro |
91.9% |
معيار GPQA-Diamond: النتائج، لوحة المتصدرين ومقارنة نماذج الذكاء الاصطناعي
|
| 2025-10-24 |
Gemini 3.1 Pro Preview |
94.1% |
معيار GPQA-Diamond: النتائج، لوحة المتصدرين ومقارنة نماذج الذكاء الاصطناعي
|
| 2025-10-24 |
Aristotle-X1 |
92.4% |
معيار GPQA-Diamond: النتائج، لوحة المتصدرين ومقارنة نماذج الذكاء الاصطناعي
|
| 2025-09-30 |
Claude Sonnet 4.5 |
83.4% |
أنثروبيك تطلق كلود سونيت 4.5 بقدرات برمجة ووكيل محسّنة
|
| 2025-09-22 |
DeepSeek-V3.1-Terminus |
74.24% |
ديب سيك تطلق نموذج DeepSeek-V3.1-Terminus مع إصلاحات للغة والوكيل
|
| 2025-08-07 |
GPT-5 pro |
88.4% |
OpenAI تطرح GPT-5 بتوجيه موحد واستدلال على مستوى الخبراء
|
| 2025-08-07 |
GPT-5 Pro |
88.4% |
أوبن إيه آي تطلق جي بي تي-5 بمنطق تكيفي وهندسة معمارية موحدة
|
| 2025-08-07 |
GPT-5 pro |
89.4% |
OpenAI تطلق GPT-5 الموحّد مع التوجيه في الوقت الفعلي ووصول مجاني
|
| 2025-07-28 |
Kimi K2 |
75.1% |
كيمي K2: نموذج MoE مفتوح المصدر يحتوي على 1T معلمة ومُحسّن MuonClip
|
| 2025-07-28 |
Kimi K2 |
75.1% |
مونشوت تطلق Kimi K2، نموذج MoE مفتوح المصدر للوكلاء بـ 32 مليار معلمة نشطة
|
| 2025-05-30 |
Deepseek-R1-0528 |
81.0% |
ديب سيك تُحدّث نموذج R1 بتحسينات في الاستدلال ونتائج الاختبارات
|
| 2025-05-22 |
Claude Sonnet 4 |
70.0% |
أنثروبيك تطرح كلاود أوبس 4 وسونيت 4 مع التفكير الممتد واستخدام الأدوات
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
أنثروبيك تطلق كلاود أوبس 4 وسونيت 4 بتدابير سلامة ASL-3
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
أنثروبيك تطرح كلاود أوبس 4 وسونيت 4 مع التفكير الممتد واستخدام الأدوات
|
| 2025-04-16 |
OpenAI o3 |
87.7% |
OpenAI
|
| 2025-04-15 |
Gemini 2.0 Flash |
60.1% |
جوجل تطلق Gemini 2.0 Flash بجودة محسّنة وسرعة ضعف سرعة Gemini 1.5 Pro
|
| 2025-04-14 |
GPT‑4.1 nano |
50.3% |
OpenAI تُطلق GPT-4.1 وGPT-4.1 mini وGPT-4.1 nano عبر واجهة برمجة التطبيقات
|
| 2025-04-10 |
Seed1.5-Thinking |
77.3% |
يستخدم Seed1.5-Thinking التعلم بالتعزيز لتحسين الاستدلال
|
| 2025-04-05 |
Gemini 2.5 Pro |
84.0% |
جوجل توسع الوصول إلى Gemini 2.5 Pro وسط نتائج معيارية قوية
|
| 2025-03-26 |
Gemini 2.5 Pro |
84.0% |
جوجل تطلق نموذج التفكير التجريبي Gemini 2.5 Pro بسياق يتكون من مليون رمز
|
| 2025-03-25 |
Gemini 2.5 Pro (experimental) |
84.0% |
Google DeepMind تطلق نموذج Gemini 2.5 Pro التجريبي
|
| 2025-03-25 |
Gemini 2.5 Pro |
84.0% |
Google DeepMind
|
| 2025-03-24 |
DeepSeek-V3-0324 |
68.4% |
DeepSeek-V3-0324 يحسّن الاستدلال والبرمجة والكتابة الصينية مقارنة بـ DeepSeek-V3
|
| 2025-03-11 |
Grok 3 |
84.6% |
xAI تطلق Grok 3 مع الاستدلال العميق وسياق مليون رمز
|
| 2025-03-05 |
GPT-4.5 |
71.4% |
OpenAI تطلق GPT-4.5، أكبر نموذج لها، لـ ChatGPT Plus
|
| 2025-02-26 |
Claude 3.7 Sonnet |
84.8% |
مقارنة معايير التقييم بين Claude 3.7 Sonnet و o3-mini و R1 و Grok 3 Beta
|
| 2025-02-26 |
Grok 3 Beta |
84.6% |
مقارنة معايير التقييم بين Claude 3.7 Sonnet و o3-mini و R1 و Grok 3 Beta
|
| 2025-02-26 |
DeepSeek R1 |
71.5% |
مقارنة معايير التقييم بين Claude 3.7 Sonnet و o3-mini و R1 و Grok 3 Beta
|
| 2025-02-26 |
OpenAI o3-mini |
78.0% |
مقارنة معايير التقييم بين Claude 3.7 Sonnet و o3-mini و R1 و Grok 3 Beta
|
| 2025-02-26 |
Claude 3.5 Sonnet |
65.0% |
مقارنة معايير التقييم بين Claude 3.7 Sonnet و o3-mini و R1 و Grok 3 Beta
|
| 2025-02-24 |
Claude 3.7 Sonnet |
84.8% |
أنثروبيك تطلق كلاود 3.7 سونيت مع تحكم ديناميكي في التفكير
|
| 2025-02-19 |
Grok 3 (Think) |
84.6% |
xAI تطلق النسخة التجريبية من Grok 3 ووكيل DeepSearch
|
| 2024-12-20 |
o3 |
87.7% |
OpenAI تطلق نموذج o3 بأداء عالٍ في الاستدلال والبرمجة
|
| 2024-11-28 |
QwQ-32B-Preview |
65.2% |
Qwen تطلق QwQ-32B-Preview، نموذج استدلال تجريبي
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
فريق Qwen يُصدر سلسلة Qwen2 بنماذج كثيفة و MoE بحجم 72 مليار
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
تقرير Qwen2 التقني يقدم نماذج كثيفة ونماذج MoE تصل إلى 72 مليار معلمة
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
أنثروبيك تطلق ملحقاً لـ Claude 3.5 Sonnet بمعايير محسّنة في البرمجة والرؤية
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
Anthropic
|
| 2023-11-20 |
GPT-4 based baseline |
39.0% |
GPQA: معيار أسئلة وأجوبة على مستوى الدراسات العليا ومقاوم لبحث Google
|