Benchmark · reasoning

BIG-Bench Hard

saturated 5 परिणाम 4 मॉडल

BIG-Bench Hard (BBH), BIG-Bench से चुनी गई 23 कठिन टास्क का समूह है, जिन पर पुराने भाषा मॉडल औसत मानव मूल्यांकनकर्ता को नहीं हरा पाते थे; यह बहु-चरणीय तर्क को मापता है और exact-match सटीकता से अंक देता है।

और पढ़ें
उदाहरण
एक टास्क प्रकार जैसे Boolean Expressions—एक नेस्टेड True/False व्यंजक का मान निकालना—साथ ही अन्य जैसे बहु-चरणीय अंकगणित, तिथि समझ, तार्किक निगमन, फेंटी गई वस्तुओं का अनुसरण और नेविगेशन; प्रत्येक को एक उत्तर तक पहुँचने के लिए कई तर्क-चरणों की ज़रूरत होती है।
स्कोरिंग
प्रति-आइटम exact-match सटीकता: मॉडल का निकाला गया अंतिम उत्तर संदर्भ लेबल (एक बहुविकल्पीय विकल्प या छोटी स्ट्रिंग) से बिल्कुल मेल खाना चाहिए। मुख्य आँकड़ा 23 टास्क पर सटीकता का मैक्रो-औसत है, जिसे आम तौर पर सीधे उत्तर (answer-only) और few-shot chain-of-thought दोनों प्रॉम्प्टिंग के लिए बताया जाता है।
सत्यापन
किसी भविष्यवाणी को सही तभी गिना जाता है जब निकाली गई अंतिम उत्तर स्ट्रिंग संदर्भ उत्तर से बिल्कुल मेल खाती है; परिणामों की तुलना आम तौर पर BIG-Bench के औसत और अधिकतम मानव-मूल्यांकनकर्ता आधाररेखाओं से की जाती है, और chain-of-thought तथा answer-only को अलग-अलग बताया जाता है।
यह क्यों मायने रखता है
यह उस कठिन तर्क उपसमुच्चय को अलग करता है जहाँ मॉडल ऐतिहासिक रूप से इंसानों से पीछे रहते थे, और यही वह परिदृश्य था जिसने दिखाया कि chain-of-thought बड़े मॉडल को औसत मानव-मूल्यांकनकर्ता से आगे ले जा सकता है—जिससे यह बहु-चरणीय तर्क की एक मानक जाँच बन गया।
हल किया गया उदाहरण
कार्य
Boolean Expressions टास्क — निम्नलिखित बूलियन व्यंजक का परिणाम निकालें: not ( True and False )
समाधान
चरण 1: True and False = False. चरण 2: not False = True. अंतिम उत्तर: True
व्याख्या
बूलियन 'and' तब तक False देता है जब तक दोनों ऑपरेंड True न हों, इसलिए (True and False) = False है; False का निषेध True देता है। मूल्यांकन अंतिम उत्तर स्ट्रिंग का संदर्भ लेबल से exact-match है।
0 24.5 49 73.5 98 2024-06-20 2024-09-18 2024-12-17 Claude 3.5 Sonnet · 93.1 · 2024-06-20 Qwen2-72B · 82.4 · 2024-07-15 Qwen2-72B · 82.4 · 2024-07-15 Falcon3-7B-Base · 51 · 2024-12-17 Falcon3-10B-Base · 59.7 · 2024-12-17
Claude 3.5 Sonnet Qwen2-72B Falcon3-7B-Base Falcon3-10B-Base
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2024-12-17 Falcon3-7B-Base 51.0% Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए
2024-12-17 Falcon3-10B-Base 59.7% Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए
2024-07-15 Qwen2-72B 82.4% Qwen2 तकनीकी रिपोर्ट में 72B तक घन और MoE मॉडल पेश किए गए
2024-07-15 Qwen2-72B 82.4% Qwen टीम ने 72B डेंस और MoE मॉडल के साथ Qwen2 सीरीज जारी की
2024-06-20 Claude 3.5 Sonnet 93.1% एन्थ्रोपिक ने क्लॉड 3.5 सॉनेट के लिए कोडिंग और विज़न बेंचमार्क में सुधार के साथ एक एडेन्डम जारी किया