Benchmark · reasoning

BIG-Bench Hard

saturated 5 نتائج 4 نماذج

‏BIG-Bench Hard (BBH) هو مجموعة من 23 مهمة صعبة مأخوذة من BIG-Bench عجزت فيها نماذج اللغة السابقة عن تجاوز المُقيِّم البشري المتوسط؛ وهو يقيس الاستدلال متعدد الخطوات ويُسجَّل بدقة المطابقة التامة (exact-match).

اقرأ المزيد
مثال
نوع مهمة مثل Boolean Expressions — تقييم تعبير متداخل من True/False — إلى جانب مهام أخرى مثل الحساب متعدد الخطوات وفهم التواريخ والاستنتاج المنطقي وتتبع الأشياء المخلوطة والملاحة؛ ويتطلب كل منها عدة خطوات استدلالية للوصول إلى إجابة واحدة.
طريقة التقييم
دقة المطابقة التامة لكل بند: يجب أن تساوي الإجابة النهائية المستخرَجة من النموذج التسمية المرجعية تمامًا (خيار من متعدد أو سلسلة نصية قصيرة). الرقم الرئيسي هو متوسط الدقة الماكروي عبر المهام الـ23، ويُبلَّغ عنه عادةً لكل من الإجابة المباشرة (answer-only) و few-shot chain-of-thought.
التحقق
لا تُحتسب الإجابة صحيحة إلا عندما تطابق سلسلة الإجابة النهائية المستخرَجة الإجابة المرجعية تمامًا؛ وتُقارَن النتائج عادةً بخطوط الأساس للمُقيِّم البشري المتوسط والأقصى من BIG-Bench، ويُبلَّغ عن chain-of-thought و answer-only كلٍّ على حدة.
لماذا يهم
إنه يعزل المجموعة الفرعية الصعبة من الاستدلال التي كانت النماذج فيها تاريخيًا متأخرة عن البشر، وكان هو الإطار الذي أظهر أن chain-of-thought يمكن أن يدفع النماذج الكبيرة إلى ما يتجاوز المُقيِّم البشري المتوسط، مما يجعله اختبارًا معياريًا للاستدلال متعدد الخطوات.
مثال محلول
المهمة
مهمة Boolean Expressions — احسب نتيجة التعبير المنطقي التالي: not ( True and False )
الحل
الخطوة 1: True and False = False. الخطوة 2: not False = True. الإجابة النهائية: True
الشرح
تعطي عملية 'and' المنطقية False ما لم يكن كلا المعاملين True، لذا فإن (True and False) تساوي False؛ ونفي False يعطي True. التقييم هو المطابقة التامة لسلسلة الإجابة النهائية مع التسمية المرجعية.
0 24.5 49 73.5 98 2024-06-20 2024-09-18 2024-12-17 Claude 3.5 Sonnet · 93.1 · 2024-06-20 Qwen2-72B · 82.4 · 2024-07-15 Qwen2-72B · 82.4 · 2024-07-15 Falcon3-7B-Base · 51 · 2024-12-17 Falcon3-10B-Base · 59.7 · 2024-12-17
Claude 3.5 Sonnet Qwen2-72B Falcon3-7B-Base Falcon3-10B-Base
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2024-12-17 Falcon3-7B-Base 51.0% عائلة Falcon3 تطلق خمسة نماذج مفتوحة المصدر بقدرات محسّنة في العلوم والرياضيات والبرمجة
2024-12-17 Falcon3-10B-Base 59.7% عائلة Falcon3 تطلق خمسة نماذج مفتوحة المصدر بقدرات محسّنة في العلوم والرياضيات والبرمجة
2024-07-15 Qwen2-72B 82.4% تقرير Qwen2 التقني يقدم نماذج كثيفة ونماذج MoE تصل إلى 72 مليار معلمة
2024-07-15 Qwen2-72B 82.4% فريق Qwen يُصدر سلسلة Qwen2 بنماذج كثيفة و MoE بحجم 72 مليار
2024-06-20 Claude 3.5 Sonnet 93.1% أنثروبيك تطلق ملحقاً لـ Claude 3.5 Sonnet بمعايير محسّنة في البرمجة والرؤية