Benchmark · agentic

τ²-bench

17 परिणाम 13 मॉडल

τ²-bench, τ-bench का एक अद्यतन संस्करण है जो टूल का उपयोग करने वाले संवादात्मक AI एजेंट्स को «dual-control» (दोहरे नियंत्रण) कार्यों पर परखता है, जहाँ काम पूरा करने के लिए एजेंट और एक सिम्युलेटेड उपयोगकर्ता दोनों कार्रवाई कर सकते हैं। मुख्य मीट्रिक हल किए गए कार्यों का प्रतिशत है (कार्यों पर औसत रिवॉर्ड)।

और पढ़ें
उदाहरण
एक तकनीकी-सहायता परिदृश्य: एजेंट ग्राहक का खाता देखता है और डोमेन की नीति का पालन करता है, साथ ही एक सिम्युलेटेड उपयोगकर्ता को उसके अपने डिवाइस पर कदम उठाने के लिए मार्गदर्शन देता है (उदाहरण के लिए, कोई सेटिंग बदलना), और समस्या हल करने के लिए दोनों को आपस में तालमेल बिठाना होता है।
स्कोरिंग
प्रत्येक कार्य के अंत में स्वचालित रूप से जाँचा जाता है कि सिस्टम/डेटाबेस की अंतिम स्थिति अपेक्षित परिणाम से मेल खाती है या नहीं, जिससे उस कार्य के लिए रिवॉर्ड मिलता है; रिपोर्ट किया गया स्कोर हल किए गए कार्यों का प्रतिशत होता है (या औसत रिवॉर्ड)।
सत्यापन
स्वीकृति पूरी तरह प्रोग्राम-आधारित है — एनवायरनमेंट अंतिम स्थिति (और आवश्यक कार्रवाइयों) की तुलना अपेक्षित परिणाम से करता है, बिना किसी मानवीय मूल्यांकन के, इसलिए कोई कार्य तभी गिना जाता है जब परिणाम मेल खाता है।
यह क्यों मायने रखता है
यह महत्वपूर्ण है क्योंकि वास्तविक सहायक अक्सर अकेले कार्य नहीं कर सकते — उन्हें उपयोगकर्ता को निर्देश देना और उसके साथ तालमेल बिठाना पड़ता है — और यह दोहरे-नियंत्रण की व्यवस्था संचार व समन्वय की उन खामियों को उजागर करती है जिन्हें एकल-कर्ता वाले टूल बेंचमार्क चूक जाते हैं।
हल किया गया उदाहरण
कार्य
τ²-bench, telecom (dual-control) डोमेन: एक सिम्युलेटेड यूज़र लिखता है: «आज सुबह से मेरा mobile data नहीं चल रहा, लेकिन कॉल और SMS अब भी काम कर रहे हैं।» ऑपरेटर के नीति दस्तावेज़ और टूल्स — साथ ही वे डिवाइस क्रियाएँ जो यूज़र अपने फ़ोन पर स्वयं कर सकता है — दिए जाने पर, ग्राहक की पहचान सत्यापित करें, खराबी का निदान करें और mobile data बहाल करें।
समाधान
Correct agent trajectory (telecom tools + user-side device actions): 1. get_customer_by_phone(number); confirm identity via name + DOB. 2. get_line_status(line_id) → "active"; get_network_status(region) → "operational" (rules out account suspension and network outage). 3. Follow the "data down / voice up" branch: user confirms Airplane Mode is OFF, then agent instructs the user to switch "Mobile Data" ON. 4. Verify data is restored; apply NO billing credit (policy forbids a fee/credit for a self-service fix). Resolution → user enables Mobile Data; connectivity restored, account state unchanged.
व्याख्या
जब लाइन active है और नेटवर्क में कोई खराबी नहीं, फिर भी वॉइस और SMS चलते हुए data बंद है, तो खराबी डिवाइस की ओर है, इसलिए नीति का ट्रबलशूटिंग ट्री यूज़र को Mobile Data दोबारा चालू करने के लिए निर्देशित करके इसे हल करता है (और स्व-सुधार के लिए किसी भी सद्भावना क्रेडिट को मना करता है)। τ²-bench प्रति कार्य एक इनाम (0/1) देता है: यह जाँचता है कि एनवायरनमेंट/डेटाबेस अपेक्षित अंतिम स्थिति तक पहुँचता है और सभी आवश्यक क्रियाएँ व बताई गई जानकारी मौजूद हैं, फिर pass^k मेट्रिक से बार-बार के परीक्षणों में विश्वसनीयता बताता है।
0 25 50 75 100 2024-10-22 2025-09-14 2026-08-08 Claude 3.5 Sonnet · 69.2 · 2024-10-22 Claude 3.7 Sonnet · 81.2 · 2025-02-24 Kimi K2 · 66.1 · 2025-07-28 Kimi K2 · 66.1 · 2025-07-28 GLM-4.5 · 90.6 · 2025-08-06 GPT-5 · 63.5 · 2025-08-07 GPT‑5 · 96.7 · 2025-08-07 Kimi K2 Thinking · 93 · 2025-11-07 Kimi K2 Thinking · 93 · 2025-11-19 GPT-5.2 Thinking · 98.7 · 2025-12-11 GPT-5.2 Thinking · 98.7 · 2025-12-11 GPT-5.2 Thinking · 98.7 · 2025-12-11 Claude Opus 4.6 · 91.9 · 2026-02-05 Step 3.5 Flash · 88.2 · 2026-02-10 GPT-5.5 · 98 · 2026-04-25 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) · 41.7 · 2026-07-28 Pokee-Isaac 28B · 66.2 · 2026-08-08
Claude 3.5 Sonnet Claude 3.7 Sonnet Kimi K2 GLM-4.5 GPT-5 GPT‑5 Kimi K2 Thinking GPT-5.2 Thinking Claude Opus 4.6 Step 3.5 Flash GPT-5.5 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) Pokee-Isaac 28B
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-08-08 Pokee-Isaac 28B 66.2% Pokee AI ने Pokee-Isaac 28B जारी किया, जो इन-बाउंड्री डिप्लॉयमेंट के लिए 10M-टोकन संदर्भ मॉडल है
2026-07-28 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) 41.69% AgentOmnia पूर्ण-दृश्य अनुप्रयोगों में एजेंटिक मॉडलों का स्केलिंग करता है
2026-04-25 GPT-5.5 98.0% OpenAI ने GPT-5.5 जारी किया, एक नई आधार से पुनः प्रशिक्षित मॉडल जिसमें मूल ओमिमोडल प्रोसेसिंग है
2026-02-10 Step 3.5 Flash 88.2% चरण 3.5 फ्लैश: खुला 11B-सक्रिय MoE मॉडल अग्रणी स्तर की एजेंटिक प्रदर्शन प्राप्त करता है
2026-02-05 Claude Opus 4.6 91.9% Anthropic ने Claude Opus 4.6 जारी की, जिसमें 1M संदर्भ खिड़की और एजेंटिक सुधार शामिल हैं
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI ने कोडिंग, लंबे-संदर्भ और तर्क क्षमताओं में सुधार के साथ GPT-5.2 पेश किया
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI ने GPT-5.2 जारी किया, जो कोडिंग और तर्कशीलता बेंचमार्क्स में Gemini 3 से बेहतर है
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI ने पेश किया GPT-5.2 जो पेशेवर ज्ञान कार्य के लिए अत्याधुनिक क्षमताओं से सुसज्जित है
2025-11-19 Kimi K2 Thinking 93.0% Moonshot AI ने एजेंटिक टूल उपयोग के साथ Kimi K2 Thinking जारी किया
2025-11-07 Kimi K2 Thinking 93.0% Moonshot AI ने Kimi K2 Thinking जारी किया, एक ओपन-सोर्स 1T पैरामीटर तर्क मॉडल
2025-08-07 GPT-5 63.5% OpenAI ने रियल-टाइम राउटिंग और मुफ्त एक्सेस के साथ एकत्रीकृत GPT-5 लॉन्च किया
2025-08-07 GPT‑5 96.7% OpenAI ने कोडिंग और एजेंटिक सुधारों के साथ GPT-5 API जारी किया
2025-08-06 GLM-4.5 90.6% ज़ीपू एआई ने क्लॉड और डीपसीक के बराबर GLM-4.5 मॉडल जारी किए
2025-07-28 Kimi K2 66.1% Moonshot ने Kimi K2 जारी किया, जो 32B सक्रिय पैरामीटर के साथ एक ओपन एजेंटिक MoE मॉडल है
2025-07-28 Kimi K2 66.1% Kimi K2: 1T पैरामीटर और MuonClip ऑप्टिमाइज़र के साथ ओपन MoE मॉडल
2025-02-24 Claude 3.7 Sonnet 81.2% Anthropic ने Claude 3.7 Sonnet को गतिशील तर्क नियंत्रण के साथ जारी किया
2024-10-22 Claude 3.5 Sonnet 69.2% Anthropic ने Claude 3.5 Sonnet को अपग्रेड किया, Claude 3.5 Haiku और कंप्यूटर यूज़ बीटा जारी किया