Benchmark · reasoning

Humanity's Last Exam

32 परिणाम 24 मॉडल

Humanity's Last Exam (HLE) कई विषय-क्षेत्रों (गणित, विज्ञान, मानविकी और अन्य) के अग्रणी, विशेषज्ञ-स्तर के प्रश्नों का एक बेंचमार्क है, जिसे जानबूझकर AI के लिए बेहद कठिन बनाया गया है। यह प्रदर्शन को सटीकता प्रतिशत (accuracy) के रूप में दर्शाता है।

और पढ़ें
उदाहरण
प्रत्येक आइटम केवल एक सही उत्तर वाला बंद-अंत विशेषज्ञ प्रश्न होता है; जैसे कोई उन्नत गणित की समस्या या स्नातकोत्तर-स्तर का विज्ञान प्रश्न (कुछ के साथ एक चित्र भी), जो बहुविकल्पीय या सटीक संक्षिप्त उत्तर के रूप में पूछा जाता है।
स्कोरिंग
मापदंड सटीकता (accuracy) है — यानी मॉडल कितने प्रतिशत प्रश्नों का सही उत्तर देता है। कुछ संस्करण सटीकता के साथ-साथ एक कैलिब्रेशन (आत्मविश्वास) माप भी बताते हैं।
सत्यापन
हर प्रश्न का एक ज्ञात सही उत्तर होता है, और मॉडल के उत्तर को उसी संदर्भ उत्तर से स्वतः मिलाकर आँका जाता है (बहुविकल्पीय में सही विकल्प, संक्षिप्त उत्तर में मिलान) — यह वस्तुनिष्ठ स्वचालित मूल्यांकन है, मानव मतदान नहीं।
यह क्यों मायने रखता है
सामान्य बेंचमार्क संतृप्त हो चुके हैं (शीर्ष मॉडल लगभग अधिकतम अंक पा लेते हैं), इसलिए HLE मानव विशेषज्ञ ज्ञान की अग्रिम सीमा पर एक कठिन, विभेदक परीक्षा बनने का लक्ष्य रखता है — यह मापने का एक सार्थक तरीका कि AI विशेषज्ञ-स्तर के तर्क से कितना दूर है।
हल किया गया उदाहरण
कार्य
हमिंगबर्ड (गण Apodiformes) में विशिष्ट रूप से एक द्विपार्श्वीय युग्मित अंडाकार सीसमॉइड हड्डी (sesamoid) होती है, जो m. depressor caudae के प्रवेश-स्थल के विस्तारित क्रॉस-आकार वाले एपोन्यूरोसिस (aponeurosis) के पुच्छ-पार्श्व भाग में अंतःस्थापित होती है। यह सीसमॉइड हड्डी कितने युग्मित कंडराओं (tendons) को सहारा देती है? एक ही पूर्णांक में उत्तर दें।
समाधान
4
व्याख्या
अंडाकार सीसमॉइड हड्डी पूँछ की अवनमक पेशी के क्रॉस-आकार एपोन्यूरोसिस के भीतर बनती है और उस प्रवेश-स्थल के चार युग्मित कंडराओं को सहारा देती है — यह हमिंगबर्ड की पूँछ की शारीरिकी के लिए अद्वितीय एक विशेषीकृत अस्थिभवन है। HLE प्रस्तुत पूर्णांक का संदर्भ उत्तर (4) से यथार्थ मिलान करके अंक देता है और अंशांकन के लिए अलग से आत्मविश्वास भी लेता है।
0 16 32 48 64 2025-01-23 2025-11-02 2026-08-13 the model powering deep research · 26.6 · 2025-02-02 Gemini 2.5 Pro (experimental) · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-26 Gemini 2.5 Pro · 18.8 · 2025-04-05 Grok 4 Heavy · 50.7 · 2025-07-09 GPT-5 Pro · 42 · 2025-08-07 Tongyi DeepResearch · 32.9 · 2025-09-16 DeepSeek-V3.2-Exp · 56.5 · 2025-09-29 Kimi K2 Thinking · 44.9 · 2025-11-07 MiroThinker v1.0 (72B variant) · 37.7 · 2025-11-14 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 48.4 · 2026-02-12 Kimi K2.5 · 51.8 · 2026-01-29 Claude Opus 4.6 · 53 · 2026-02-05 Claude Opus 4.6 · 40 · 2026-02-05 Claude Opus 4.6 · 53 · 2026-03-06 Claude Opus 4.7 · 46.9 · 2026-04-25 GPT-5.5 · 41.4 · 2026-04-25 Claude Fable 5 · 53 · 2026-06-09 Claude Opus 4.8 · 46 · 2026-07-01 Agents-A1 · 47.6 · 2026-07-06 PoTRE · 49.9 · 2026-07-23 Inkling-Small · 31.6 · 2026-08-03 DeepSeek-V4-Pro · 60 · 2026-08-13 DeepSeek R1 (text-only) · 9.4 · 2025-01-23 Grok 4 · 25.4 · 2025-07-09 GPT-5 · 24.8 · 2025-08-07
the model powering deep research Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Grok 4 Heavy GPT-5 Pro Tongyi DeepResearch DeepSeek-V3.2-Exp Kimi K2 Thinking MiroThinker v1.0 (72B variant) Gemini 3 Pro Gemini 3 Deep Think Kimi K2.5 Claude Opus 4.6 Claude Opus 4.7 GPT-5.5 Claude Fable 5 Claude Opus 4.8 Agents-A1 PoTRE Inkling-Small DeepSeek-V4-Pro DeepSeek R1 (text-only) Grok 4 GPT-5
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-08-13 DeepSeek-V4-Pro 60.0% DeepSeek-V4-Pro GA रिलीज ने एजेंट क्षमताओं को बढ़ाया और Responses API समर्थन जोड़ा
2026-08-03 Inkling-Small 31.6% थिंकिंग मशीन्स लैब ने 276B ओपन वेट्स मल्टीमोडल MoE मॉडल इंकलिंग-स्माल रिलीज़ किया
2026-07-23 PoTRE 49.92% PoTRE ने परीक्षण-समय तर्क के लिए विषम बहु-एजेंट ढांचे का परिचय दिया
2026-07-06 Agents-A1 47.6pts पैरामीटर नहीं, क्षितिज को स्केल करें: एक 35B एजेंट के साथ ट्रिलियन-पैरामीटर प्रदर्शन प्राप्त करना
2026-07-01 Claude Opus 4.8 46.0% Anthropic ने Claude Opus 4.8 को एडेप्टिव रीजनिंग और बेहतर ईमानदारी के साथ जारी किया
2026-06-09 Claude Fable 5 53.0% क्लाउड फेबल 5 आर्टिफिशियल एनालिसिस इंटेलिजेंस इंडेक्स पर #1 स्थान पर लॉन्च हुआ
2026-04-25 Claude Opus 4.7 46.9% OpenAI ने GPT-5.5 जारी किया, एक नई आधार से पुनः प्रशिक्षित मॉडल जिसमें मूल ओमिमोडल प्रोसेसिंग है
2026-04-25 GPT-5.5 41.4% OpenAI ने GPT-5.5 जारी किया, एक नई आधार से पुनः प्रशिक्षित मॉडल जिसमें मूल ओमिमोडल प्रोसेसिंग है
2026-03-06 Claude Opus 4.6 53.0% Anthropic ने क्लॉडियस ओपस 4.6 के लिए सिस्टम कार्ड जारी किया, जिसमें क्षमताओं और सुरक्षा मूल्यांकन का विवरण है
2026-02-12 Gemini 3 Deep Think 48.4% Google ने नए बेंचमार्क स्कोर के साथ अपग्रेडेड Gemini 3 Deep Think जारी किया
2026-02-05 Claude Opus 4.6 53.0% Anthropic ने Claude Opus 4.6 सिस्टम कार्ड प्रकाशित किया जिसमें क्षमताओं और सुरक्षा मूल्यांकन का विवरण है
2026-02-05 Claude Opus 4.6 40.0% Anthropic ने Claude Opus 4.6 जारी की, जिसमें 1M संदर्भ खिड़की और एजेंटिक सुधार शामिल हैं
2026-01-29 Kimi K2.5 51.8% Moonshot ने Kimi K2.5 मल्टीमोडल एजेंटिक मॉडल जारी किया
2025-11-18 Gemini 3 Pro 37.5% Google ने शीर्ष तर्क और बहुआयामी क्षमताओं के साथ Gemini 3 Pro जारी किया
2025-11-18 Gemini 3 Deep Think 41.0% Google ने Gemini 3 Pro को अत्याधुनिक तर्क और बहु-मोडल क्षमताओं के साथ जारी किया
2025-11-18 Gemini 3 Pro 37.5% Google ने Gemini 3 Pro को अत्याधुनिक तर्क और बहु-मोडल क्षमताओं के साथ जारी किया
2025-11-18 Gemini 3 Deep Think 41.0% Google ने शीर्ष तर्क और बहुआयामी क्षमताओं के साथ Gemini 3 Pro जारी किया
2025-11-14 MiroThinker v1.0 (72B variant) 37.7% MiroThinker v1.0 ओपन-सोर्स रिसर्च एजेंट्स के लिए इंटरैक्टिव स्केलिंग पेश करता है
2025-11-07 Kimi K2 Thinking 44.9% Moonshot AI ने Kimi K2 Thinking जारी किया, एक ओपन-सोर्स 1T पैरामीटर तर्क मॉडल
2025-09-29 DeepSeek-V3.2-Exp 56.53% DeepSeek ने लंबे संदर्भ की दक्षता के लिए स्पार्स एटेंशन के साथ DeepSeek-V3.2-Exp जारी किया
2025-09-16 Tongyi DeepResearch 32.9% Tongyi ने DeepResearch जारी किया, एक ओपन-सोर्स वेब एजेंट जो प्रोप्राइटरी प्रदर्शन के बराबर है
2025-08-07 GPT-5 Pro 42.0% OpenAI ने रियल-टाइम राउटिंग और मुफ्त एक्सेस के साथ एकत्रीकृत GPT-5 लॉन्च किया
2025-08-07 GPT-5 24.8% OpenAI
2025-07-09 Grok 4 Heavy 50.7% xAI ने स्केल्ड रीइन्फोर्समेंट लर्निंग और नेटिव टूल यूज़ के साथ Grok 4 जारी किया
2025-07-09 Grok 4 25.4% xAI
2025-04-05 Gemini 2.5 Pro 18.8% मजबूत बेंचमार्क परिणामों के बीच गूगल ने जेमिनी 2.5 प्रो तक पहुंच का विस्तार किया
2025-03-26 Gemini 2.5 Pro 18.8% गूगल ने 1M टोकन संदर्भ के साथ एक्सपेरिमेंटल जेमिनी 2.5 प्रो रीजनिंग मॉडल जारी किया
2025-03-25 Gemini 2.5 Pro (experimental) 18.8% Google DeepMind ने Gemini 2.5 Pro एक्सपेरिमेंटल मॉडल जारी किया
2025-03-25 Gemini 2.5 Pro 18.8% गूगल ने गेमिनी 2.5 प्रो थिंकिंग मॉडल पेश किया
2025-03-25 Gemini 2.5 Pro 18.8% Google ने Gemini 2.5 Pro प्रयोगात्मक मॉडल का परिचय दिया
2025-02-02 the model powering deep research 26.6% OpenAI ने ChatGPT में एजेंटिक क्षमता के रूप में 'डीप रिसर्च' लॉन्च किया
2025-01-23 DeepSeek R1 (text-only) 9.4% Humanity's Last Exam