Benchmark · reasoning
BIG-Bench Hard
BIG-Bench Hard (BBH), BIG-Bench से चुनी गई 23 कठिन टास्क का समूह है, जिन पर पुराने भाषा मॉडल औसत मानव मूल्यांकनकर्ता को नहीं हरा पाते थे; यह बहु-चरणीय तर्क को मापता है और exact-match सटीकता से अंक देता है।
और पढ़ें
- उदाहरण
- एक टास्क प्रकार जैसे Boolean Expressions—एक नेस्टेड True/False व्यंजक का मान निकालना—साथ ही अन्य जैसे बहु-चरणीय अंकगणित, तिथि समझ, तार्किक निगमन, फेंटी गई वस्तुओं का अनुसरण और नेविगेशन; प्रत्येक को एक उत्तर तक पहुँचने के लिए कई तर्क-चरणों की ज़रूरत होती है।
- स्कोरिंग
- प्रति-आइटम exact-match सटीकता: मॉडल का निकाला गया अंतिम उत्तर संदर्भ लेबल (एक बहुविकल्पीय विकल्प या छोटी स्ट्रिंग) से बिल्कुल मेल खाना चाहिए। मुख्य आँकड़ा 23 टास्क पर सटीकता का मैक्रो-औसत है, जिसे आम तौर पर सीधे उत्तर (answer-only) और few-shot chain-of-thought दोनों प्रॉम्प्टिंग के लिए बताया जाता है।
- सत्यापन
- किसी भविष्यवाणी को सही तभी गिना जाता है जब निकाली गई अंतिम उत्तर स्ट्रिंग संदर्भ उत्तर से बिल्कुल मेल खाती है; परिणामों की तुलना आम तौर पर BIG-Bench के औसत और अधिकतम मानव-मूल्यांकनकर्ता आधाररेखाओं से की जाती है, और chain-of-thought तथा answer-only को अलग-अलग बताया जाता है।
- यह क्यों मायने रखता है
- यह उस कठिन तर्क उपसमुच्चय को अलग करता है जहाँ मॉडल ऐतिहासिक रूप से इंसानों से पीछे रहते थे, और यही वह परिदृश्य था जिसने दिखाया कि chain-of-thought बड़े मॉडल को औसत मानव-मूल्यांकनकर्ता से आगे ले जा सकता है—जिससे यह बहु-चरणीय तर्क की एक मानक जाँच बन गया।
हल किया गया उदाहरण
कार्य
Boolean Expressions टास्क — निम्नलिखित बूलियन व्यंजक का परिणाम निकालें: not ( True and False )
समाधान
चरण 1: True and False = False. चरण 2: not False = True. अंतिम उत्तर: True
व्याख्या
बूलियन 'and' तब तक False देता है जब तक दोनों ऑपरेंड True न हों, इसलिए (True and False) = False है; False का निषेध True देता है। मूल्यांकन अंतिम उत्तर स्ट्रिंग का संदर्भ लेबल से exact-match है।
| तारीख़ | मॉडल | स्कोर | स्रोत |
|---|---|---|---|
| 2024-12-17 | Falcon3-7B-Base | 51.0% | Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए |
| 2024-12-17 | Falcon3-10B-Base | 59.7% | Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए |
| 2024-07-15 | Qwen2-72B | 82.4% | Qwen2 तकनीकी रिपोर्ट में 72B तक घन और MoE मॉडल पेश किए गए |
| 2024-07-15 | Qwen2-72B | 82.4% | Qwen टीम ने 72B डेंस और MoE मॉडल के साथ Qwen2 सीरीज जारी की |
| 2024-06-20 | Claude 3.5 Sonnet | 93.1% | एन्थ्रोपिक ने क्लॉड 3.5 सॉनेट के लिए कोडिंग और विज़न बेंचमार्क में सुधार के साथ एक एडेन्डम जारी किया |