Benchmark · agentic

BrowseComp

26 परिणाम 23 मॉडल

BrowseComp, OpenAI का वह बेंचमार्क है जो वेब ब्राउज़ करने वाले AI एजेंट्स की जाँच करता है कि वे इंटरनेट पर बिखरे मुश्किल-से-मिलने वाले तथ्यों को खोज पाते हैं या नहीं। परिणाम सही उत्तर दिए गए प्रश्नों के प्रतिशत के रूप में बताया जाता है।

और पढ़ें
उदाहरण
एक सामान्य प्रश्न ऐसा होता है जिसका छोटा तथ्यात्मक उत्तर — कोई नाम, तारीख या संख्या — वेब में गहराई में छिपा होता है और उसे ढूँढने के लिए कई पृष्ठों पर लगातार, बहु-चरणीय खोज करनी पड़ती है।
स्कोरिंग
मापदंड सटीकता (accuracy) है: उन प्रश्नों का प्रतिशत जिनमें एजेंट का उत्तर एकमात्र ज्ञात सही उत्तर से मेल खाता है।
सत्यापन
उत्तर तभी स्वीकार होता है जब वह पहले से तय किए गए सही उत्तर से मेल खाए (एग्ज़ैक्ट-मैच शैली में); प्रश्न इस तरह बनाए जाते हैं कि उत्तर ढूँढना कठिन हो पर एक बार मिल जाने पर सत्यापित करना आसान हो।
यह क्यों मायने रखता है
यह एक ऐसी क्षमता को परखता है जो साधारण चैटबॉट्स में नहीं होती — कई चरणों में गहन, लगातार वेब शोध — इसलिए यह मज़बूत मॉडलों के लिए भी एजेंटिक ब्राउज़िंग की एक कठिन परीक्षा बना रहता है।
हल किया गया उदाहरण
कार्य
BrowseComp आइटम: «2010 और 2015 के बीच रिलीज़ हुई एक ऐसी फ़ीचर फ़िल्म बताइए जो (1) सर्वश्रेष्ठ फ़िल्म का Academy Award जीत चुकी हो, (2) एक गुप्त बचाव अभियान को नाटकीय रूप में दिखाती हो, (3) उसी व्यक्ति द्वारा निर्देशित हो जो मुख्य भूमिका निभाता है, और (4) जिसका क्लाइमेक्स तेहरान के एक हवाई अड्डे पर हो। केवल फ़िल्म का नाम दीजिए।»
समाधान
सभी शर्तें एक ही फ़िल्म पर मिलती हैं — 2010–2015 की सर्वश्रेष्ठ फ़िल्म विजेता, जो अपने मुख्य अभिनेता द्वारा ही निर्देशित एक गुप्त बचाव नाटक है और जिसका क्लाइमेक्स तेहरान के हवाई अड्डे पर होता है। अंतिम उत्तर: Argo (2012), निर्देशन और मुख्य भूमिका Ben Affleck द्वारा।
व्याख्या
हर संकेत उम्मीदवारों को घटाता जाता है — 2010–2015 की सर्वश्रेष्ठ फ़िल्म विजेता, फिर वे बचाव-नाटक जिन्हें उनके मुख्य अभिनेता ने निर्देशित किया, और अंत में वह जिसका क्लाइमेक्स तेहरान हवाई अड्डे पर है — केवल Argo बचती है, जिसे Ben Affleck ने निर्देशित भी किया और उसमें अभिनय भी। BrowseComp छोटे मुक्त-पाठ उत्तर को संदर्भ से सटीक या मॉडल-जाँचित मिलान द्वारा मिलाता है, इसलिए «Argo» सही गिना जाता है।
0 24.5 49 73.5 98 2025-04-10 2025-12-11 2026-08-13 GLM-4.5 · 26.4 · 2025-08-06 Tongyi DeepResearch · 43.4 · 2025-09-16 Kimi K2 Thinking · 60.2 · 2025-11-07 MiroThinker v1.0 (72B variant) · 47.1 · 2025-11-14 Kimi K2.5 · 74.9 · 2026-01-27 Claude Opus 4.6 · 84 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-03-06 Step 3.5 Flash · 69 · 2026-02-10 Qwen3.5-397B-A17B · 78.6 · 2026-02-16 Opus 4.6 · 84 · 2026-04-21 GPT-5.4 · 82.7 · 2026-04-21 GPT-5.4 Pro · 89.3 · 2026-04-21 Gemini 3.1 Pro · 85.9 · 2026-04-23 GPT-5.5 · 84.4 · 2026-04-23 Agents-A1 · 75.5 · 2026-07-06 GPT-5.6 Sol · 92.2 · 2026-07-09 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Qwen3-4B · 35.6 · 2026-07-16 Qwen3-30B-A3B · 42.6 · 2026-07-16 GPT-Live-1 · 75.2 · 2026-07-17 Kimi K3 · 91.2 · 2026-07-17 GPT-5.6 Luna (Extra High) · 84.0 · 2026-08-13 GPT-5.5 (Extra High) · 84.4 · 2026-08-13 OpenAI Deep Research · 51.5 · 2025-04-10
GLM-4.5 Tongyi DeepResearch Kimi K2 Thinking MiroThinker v1.0 (72B variant) Kimi K2.5 Claude Opus 4.6 Step 3.5 Flash Qwen3.5-397B-A17B Opus 4.6 GPT-5.4 GPT-5.4 Pro Gemini 3.1 Pro GPT-5.5 Agents-A1 GPT-5.6 Sol Mach-Mind-4-Flash Qwen3-4B Qwen3-30B-A3B GPT-Live-1 Kimi K3 GPT-5.6 Luna (Extra High) GPT-5.5 (Extra High) OpenAI Deep Research
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-08-13 GPT-5.6 Luna (Extra High) 84.04% OpenAI ने किफ़ायती और उच्च-प्रदर्शन एजेंटिक वर्कफ़्लो के लिए GPT-5.6 जारी किया
2026-08-13 GPT-5.5 (Extra High) 84.36% OpenAI ने किफ़ायती और उच्च-प्रदर्शन एजेंटिक वर्कफ़्लो के लिए GPT-5.6 जारी किया
2026-07-17 Kimi K3 91.2% Moonshot AI ने 1M संदर्भ के साथ 2.8T-पैरामीटर MoE मॉडल Kimi K3 को ओपन किया
2026-07-17 GPT-Live-1 75.2% OpenAI ने फुल-डप्लेक्स वॉइस मॉडल्स जारी किए और जर्मन अदालत ने Google को AI ओवरव्यू के लिए जिम्मेदार ठहराया
2026-07-16 Qwen3-4B 35.6% TRACE टर्न-लेवल क्रेडिट एस्टीमेशन के माध्यम से लॉन्ग-होराइजन एजेंट टूल-यूज़ को सुधारता है
2026-07-16 Qwen3-30B-A3B 42.6% TRACE टर्न-लेवल क्रेडिट एस्टीमेशन के माध्यम से लॉन्ग-होराइजन एजेंट टूल-यूज़ को सुधारता है
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash: पोस्ट-ट्रेनिंग ऑप्टिमाइज़ेशन के माध्यम से 35B MoE एजेंटिक मॉडल बड़े मॉडल्स के बराबर
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash: पोस्ट-ट्रेनिंग ऑप्टिमाइज़ेशन के माध्यम से 35B MoE एजेंटिक मॉडल बड़े मॉडल्स के बराबर
2026-07-09 GPT-5.6 Sol 92.2% OpenAI ने Sol, Terra और Luna मॉडलों के साथ GPT-5.6 परिवार लॉन्च किया
2026-07-06 Agents-A1 75.5pts पैरामीटर नहीं, क्षितिज को स्केल करें: एक 35B एजेंट के साथ ट्रिलियन-पैरामीटर प्रदर्शन प्राप्त करना
2026-04-23 Gemini 3.1 Pro 85.9% ओपनएआई ने एजेंटिक क्षमताओं और दोगुनी एपीआई मूल्य निर्धारण के साथ जीपीटी-5.5 जारी की
2026-04-23 GPT-5.5 84.4% ओपनएआई ने एजेंटिक क्षमताओं और दोगुनी एपीआई मूल्य निर्धारण के साथ जीपीटी-5.5 जारी की
2026-04-21 Opus 4.6 84.0% Google ने Gemini 3.1 Pro पर निर्मित Deep Research और Deep Research Max एजेंट्स लॉन्च किए
2026-04-21 GPT-5.4 82.7% Google ने Gemini 3.1 Pro पर निर्मित Deep Research और Deep Research Max एजेंट्स लॉन्च किए
2026-04-21 GPT-5.4 Pro 89.3% Google ने Gemini 3.1 Pro पर निर्मित Deep Research और Deep Research Max एजेंट्स लॉन्च किए
2026-03-06 Claude Opus 4.6 83.73% Anthropic ने क्लॉडियस ओपस 4.6 के लिए सिस्टम कार्ड जारी किया, जिसमें क्षमताओं और सुरक्षा मूल्यांकन का विवरण है
2026-02-16 Qwen3.5-397B-A17B 78.6% Qwen ने FP8-क्वांटाइज्ड Qwen3.5-397B-A17B मॉडल जारी किया
2026-02-10 Step 3.5 Flash 69.0% चरण 3.5 फ्लैश: खुला 11B-सक्रिय MoE मॉडल अग्रणी स्तर की एजेंटिक प्रदर्शन प्राप्त करता है
2026-02-05 Claude Opus 4.6 84.0% Anthropic ने Claude Opus 4.6 जारी की, जिसमें 1M संदर्भ खिड़की और एजेंटिक सुधार शामिल हैं
2026-02-05 Claude Opus 4.6 83.73% Anthropic ने Claude Opus 4.6 सिस्टम कार्ड प्रकाशित किया जिसमें क्षमताओं और सुरक्षा मूल्यांकन का विवरण है
2026-01-27 Kimi K2.5 74.9% Moonshot ने Agent Swarm तकनीक के साथ Kimi K2.5 जारी किया
2025-11-14 MiroThinker v1.0 (72B variant) 47.1% MiroThinker v1.0 ओपन-सोर्स रिसर्च एजेंट्स के लिए इंटरैक्टिव स्केलिंग पेश करता है
2025-11-07 Kimi K2 Thinking 60.2% Moonshot AI ने Kimi K2 Thinking जारी किया, एक ओपन-सोर्स 1T पैरामीटर तर्क मॉडल
2025-09-16 Tongyi DeepResearch 43.4% Tongyi ने DeepResearch जारी किया, एक ओपन-सोर्स वेब एजेंट जो प्रोप्राइटरी प्रदर्शन के बराबर है
2025-08-06 GLM-4.5 26.4% ज़ीपू एआई ने क्लॉड और डीपसीक के बराबर GLM-4.5 मॉडल जारी किए
2025-04-10 OpenAI Deep Research 51.5% OpenAI