Benchmark · reasoning
BIG-Bench Hard
BIG-Bench Hard (BBH) هو مجموعة من 23 مهمة صعبة مأخوذة من BIG-Bench عجزت فيها نماذج اللغة السابقة عن تجاوز المُقيِّم البشري المتوسط؛ وهو يقيس الاستدلال متعدد الخطوات ويُسجَّل بدقة المطابقة التامة (exact-match).
اقرأ المزيد
- مثال
- نوع مهمة مثل Boolean Expressions — تقييم تعبير متداخل من True/False — إلى جانب مهام أخرى مثل الحساب متعدد الخطوات وفهم التواريخ والاستنتاج المنطقي وتتبع الأشياء المخلوطة والملاحة؛ ويتطلب كل منها عدة خطوات استدلالية للوصول إلى إجابة واحدة.
- طريقة التقييم
- دقة المطابقة التامة لكل بند: يجب أن تساوي الإجابة النهائية المستخرَجة من النموذج التسمية المرجعية تمامًا (خيار من متعدد أو سلسلة نصية قصيرة). الرقم الرئيسي هو متوسط الدقة الماكروي عبر المهام الـ23، ويُبلَّغ عنه عادةً لكل من الإجابة المباشرة (answer-only) و few-shot chain-of-thought.
- التحقق
- لا تُحتسب الإجابة صحيحة إلا عندما تطابق سلسلة الإجابة النهائية المستخرَجة الإجابة المرجعية تمامًا؛ وتُقارَن النتائج عادةً بخطوط الأساس للمُقيِّم البشري المتوسط والأقصى من BIG-Bench، ويُبلَّغ عن chain-of-thought و answer-only كلٍّ على حدة.
- لماذا يهم
- إنه يعزل المجموعة الفرعية الصعبة من الاستدلال التي كانت النماذج فيها تاريخيًا متأخرة عن البشر، وكان هو الإطار الذي أظهر أن chain-of-thought يمكن أن يدفع النماذج الكبيرة إلى ما يتجاوز المُقيِّم البشري المتوسط، مما يجعله اختبارًا معياريًا للاستدلال متعدد الخطوات.
مثال محلول
المهمة
مهمة Boolean Expressions — احسب نتيجة التعبير المنطقي التالي: not ( True and False )
الحل
الخطوة 1: True and False = False. الخطوة 2: not False = True. الإجابة النهائية: True
الشرح
تعطي عملية 'and' المنطقية False ما لم يكن كلا المعاملين True، لذا فإن (True and False) تساوي False؛ ونفي False يعطي True. التقييم هو المطابقة التامة لسلسلة الإجابة النهائية مع التسمية المرجعية.
| التاريخ | النموذج | النتيجة | المصدر |
|---|---|---|---|
| 2024-12-17 | Falcon3-7B-Base | 51.0% | عائلة Falcon3 تطلق خمسة نماذج مفتوحة المصدر بقدرات محسّنة في العلوم والرياضيات والبرمجة |
| 2024-12-17 | Falcon3-10B-Base | 59.7% | عائلة Falcon3 تطلق خمسة نماذج مفتوحة المصدر بقدرات محسّنة في العلوم والرياضيات والبرمجة |
| 2024-07-15 | Qwen2-72B | 82.4% | تقرير Qwen2 التقني يقدم نماذج كثيفة ونماذج MoE تصل إلى 72 مليار معلمة |
| 2024-07-15 | Qwen2-72B | 82.4% | فريق Qwen يُصدر سلسلة Qwen2 بنماذج كثيفة و MoE بحجم 72 مليار |
| 2024-06-20 | Claude 3.5 Sonnet | 93.1% | أنثروبيك تطلق ملحقاً لـ Claude 3.5 Sonnet بمعايير محسّنة في البرمجة والرؤية |