Benchmark · reasoning

Humanity's Last Exam

32 نتائج 24 نماذج

Humanity's Last Exam (HLE) هو معيار (benchmark) يتألف من أسئلة متقدمة على مستوى الخبراء تغطي مجالات معرفية عديدة (الرياضيات والعلوم والعلوم الإنسانية وغيرها)، صُمّم عمدًا ليكون بالغ الصعوبة على الذكاء الاصطناعي. ويُقاس الأداء بنسبة الإجابات الصحيحة (accuracy).

اقرأ المزيد
مثال
كل بند سؤال خبير مغلق الإجابة وله إجابة صحيحة واحدة؛ مثل مسألة رياضيات متقدمة أو سؤال علمي بمستوى الدراسات العليا (بعضها مرفق بصورة)، يُطرح على هيئة اختيار من متعدد أو إجابة قصيرة دقيقة.
طريقة التقييم
المقياس هو الدقة (accuracy)، أي النسبة المئوية للأسئلة التي يجيب عنها النموذج إجابة صحيحة. وتُبلّغ بعض النسخ أيضًا عن مقياس معايرة (الثقة) إلى جانب الدقة.
التحقق
لكل سؤال إجابة صحيحة معروفة، وتُقيَّم إجابة النموذج آليًا بمقارنتها بتلك الإجابة المرجعية (الخيار الصحيح في الاختيار من متعدد، وتطابق الإجابة القصيرة) — تقييم آلي موضوعي لا يقوم على تصويت البشر.
لماذا يهم
أصبحت المعايير المعتادة مُشبَعة (تكاد النماذج الأفضل تبلغ السقف)، لذا يسعى HLE إلى أن يكون اختبارًا صعبًا وقادرًا على التمييز عند حدود المعرفة البشرية المتخصصة — مؤشرًا ذا دلالة على مدى بُعد الذكاء الاصطناعي عن التفكير بمستوى الخبراء.
مثال محلول
المهمة
تمتلك الطيور الطنانة (رتبة Apodiformes) بشكل فريد عظمًا سمسمانيًّا (sesamoid) بيضويًّا مزدوجًا على الجانبين، مغروسًا في الجزء الذيلي الوحشي من الصفاق (aponeurosis) المتصالب المتوسّع لموضع ارتكاز العضلة m. depressor caudae. كم عدد الأوتار (tendons) المزدوجة التي يدعمها هذا العظم السمسماني؟ أجب برقم صحيح واحد.
الحل
4
الشرح
يتكوّن العظم السمسماني البيضوي داخل الصفاق المتصالب لعضلة خافضة الذيل ويدعم أربعة أوتار مزدوجة من موضع الارتكاز ذاك — وهو تعظّم متخصّص فريد في تشريح ذيل الطيور الطنانة. يُقيّم HLE الإجابة بالمطابقة التامة للرقم الصحيح المُقدَّم مع الإجابة المرجعية (4)، ويطلب منفصلاً درجة ثقة للمعايرة.
0 16 32 48 64 2025-01-23 2025-11-02 2026-08-13 the model powering deep research · 26.6 · 2025-02-02 Gemini 2.5 Pro (experimental) · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-26 Gemini 2.5 Pro · 18.8 · 2025-04-05 Grok 4 Heavy · 50.7 · 2025-07-09 GPT-5 Pro · 42 · 2025-08-07 Tongyi DeepResearch · 32.9 · 2025-09-16 DeepSeek-V3.2-Exp · 56.5 · 2025-09-29 Kimi K2 Thinking · 44.9 · 2025-11-07 MiroThinker v1.0 (72B variant) · 37.7 · 2025-11-14 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 48.4 · 2026-02-12 Kimi K2.5 · 51.8 · 2026-01-29 Claude Opus 4.6 · 53 · 2026-02-05 Claude Opus 4.6 · 40 · 2026-02-05 Claude Opus 4.6 · 53 · 2026-03-06 Claude Opus 4.7 · 46.9 · 2026-04-25 GPT-5.5 · 41.4 · 2026-04-25 Claude Fable 5 · 53 · 2026-06-09 Claude Opus 4.8 · 46 · 2026-07-01 Agents-A1 · 47.6 · 2026-07-06 PoTRE · 49.9 · 2026-07-23 Inkling-Small · 31.6 · 2026-08-03 DeepSeek-V4-Pro · 60 · 2026-08-13 DeepSeek R1 (text-only) · 9.4 · 2025-01-23 Grok 4 · 25.4 · 2025-07-09 GPT-5 · 24.8 · 2025-08-07
the model powering deep research Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Grok 4 Heavy GPT-5 Pro Tongyi DeepResearch DeepSeek-V3.2-Exp Kimi K2 Thinking MiroThinker v1.0 (72B variant) Gemini 3 Pro Gemini 3 Deep Think Kimi K2.5 Claude Opus 4.6 Claude Opus 4.7 GPT-5.5 Claude Fable 5 Claude Opus 4.8 Agents-A1 PoTRE Inkling-Small DeepSeek-V4-Pro DeepSeek R1 (text-only) Grok 4 GPT-5
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-08-13 DeepSeek-V4-Pro 60.0% إصدار DeepSeek-V4-Pro العام يعزز قدرات الوكيل ويضيف دعم API الاستجابات
2026-08-03 Inkling-Small 31.6% مختبر الآلات المفكرة يُصدر Inkling-Small، وهو نموذج MoE متعدد الوسائط بوزن مفتوح يتكون من 276 مليار معلمة
2026-07-23 PoTRE 49.92% PoTRE تقدم إطار عمل متعدد الوكلاء غير المتجانس للاستدلال أثناء الاختبار
2026-07-06 Agents-A1 47.6pts توسيع الأفق وليس المعلمات: بلوغ أداء النليون مع وكيل بحجم 35 مليار
2026-07-01 Claude Opus 4.8 46.0% أنثروبيك تطلق كلود أوبوس 4.8 مع استنتاج تكيفي وصدق محسّن
2026-06-09 Claude Fable 5 53.0% إطلاق كلاود فابل 5 في المرتبة الأولى على مؤشر ذكاء تحليلات الذكاء الاصطناعي
2026-04-25 Claude Opus 4.7 46.9% OpenAI تطلق GPT-5.5، نموذج مُعاد تدريبه من الصفر مع معالجة أومني مودال أصلية
2026-04-25 GPT-5.5 41.4% OpenAI تطلق GPT-5.5، نموذج مُعاد تدريبه من الصفر مع معالجة أومني مودال أصلية
2026-03-06 Claude Opus 4.6 53.0% أنثروبيك تطلق بطاقة نظام كلاود أوبس 4.6 مفصلة القدرات وتقييمات السلامة
2026-02-12 Gemini 3 Deep Think 48.4% جوجل تطلق نسخة مطورة من Gemini 3 Deep Think بنتائج معايير جديدة
2026-02-05 Claude Opus 4.6 53.0% أنثروبيك تنشر بطاقة نظام كلاود أوبوس 4.6 بتفاصيل القدرات وتقييمات السلامة
2026-02-05 Claude Opus 4.6 40.0% أنثروبيك تطلق كلاود أوبوس 4.6 بنافذة سياق بـ 1 مليون وتطبيقات عميلية محسّنة
2026-01-29 Kimi K2.5 51.8% مونشوت تطلق نموذج كيمي K2.5 متعدد الوسائط والوكيل
2025-11-18 Gemini 3 Pro 37.5% جوجل تطلق Gemini 3 Pro بقدرة reasoning متعددة الوسائط متقدمة
2025-11-18 Gemini 3 Deep Think 41.0% جوجل تطلق Gemini 3 Pro بقدرات استدلال متعددة الوسائط متقدمة
2025-11-18 Gemini 3 Pro 37.5% جوجل تطلق Gemini 3 Pro بقدرات استدلال متعددة الوسائط متقدمة
2025-11-18 Gemini 3 Deep Think 41.0% جوجل تطلق Gemini 3 Pro بقدرة reasoning متعددة الوسائط متقدمة
2025-11-14 MiroThinker v1.0 (72B variant) 37.7% MiroThinker v1.0 يقدم القياس التفاعلي لوكلاء البحث مفتوحة المصدر
2025-11-07 Kimi K2 Thinking 44.9% Moonshot AI تطلق Kimi K2 Thinking، نموذج استدلال مفتوح المصدر بـ 1T معلمة
2025-09-29 DeepSeek-V3.2-Exp 56.53% DeepSeek تطلق DeepSeek-V3.2-Exp مع انتباه متناثر (Sparse Attention) لكفاءة السياق الطويل
2025-09-16 Tongyi DeepResearch 32.9% تونغي تطلق DeepResearch، وكيل ويب مفتوح المصدر يعادل الأداء الخاص
2025-08-07 GPT-5 Pro 42.0% OpenAI تطلق GPT-5 الموحّد مع التوجيه في الوقت الفعلي ووصول مجاني
2025-08-07 GPT-5 24.8% OpenAI
2025-07-09 Grok 4 Heavy 50.7% xAI تطلق Grok 4 بتعلم التعزيز المقيّد واستخدام الأدوات الأصلي
2025-07-09 Grok 4 25.4% xAI
2025-04-05 Gemini 2.5 Pro 18.8% جوجل توسع الوصول إلى Gemini 2.5 Pro وسط نتائج معيارية قوية
2025-03-26 Gemini 2.5 Pro 18.8% جوجل تطلق نموذج التفكير التجريبي Gemini 2.5 Pro بسياق يتكون من مليون رمز
2025-03-25 Gemini 2.5 Pro (experimental) 18.8% Google DeepMind تطلق نموذج Gemini 2.5 Pro التجريبي
2025-03-25 Gemini 2.5 Pro 18.8% جوجل تطرح نموذج التفكير جيمينى 2.5 برو
2025-03-25 Gemini 2.5 Pro 18.8% جوجل تقدم النموذج التجريبي Gemini 2.5 Pro
2025-02-02 the model powering deep research 26.6% OpenAI تطلق البحث العميق في ChatGPT كقدرة وكيلاوية
2025-01-23 DeepSeek R1 (text-only) 9.4% Humanity's Last Exam