Benchmark · agentic

τ²-bench

17 نتائج 13 نماذج

‏τ²-bench هو نسخة محدَّثة من τ-bench تُقيّم وكلاء الذكاء الاصطناعي الحواريين الذين يستخدمون الأدوات في مهام «التحكّم المزدوج» (dual-control)، حيث يمكن لكل من الوكيل والمستخدم المُحاكى اتخاذ إجراءات لإنجاز المهمة. المقياس الرئيسي هو نسبة المهام المحلولة (متوسط المكافأة عبر المهام).

اقرأ المزيد
مثال
سيناريو دعم فني: يبحث الوكيل عن حساب العميل ويتّبع سياسة المجال بينما يوجّه مستخدمًا مُحاكى لتنفيذ خطوات على جهازه الخاص (مثل تغيير أحد الإعدادات)، ويجب أن ينسّق الطرفان معًا لحل المشكلة.
طريقة التقييم
تنتهي كل مهمة بفحص آلي لما إذا كانت الحالة النهائية للنظام/قاعدة البيانات تطابق النتيجة المطلوبة، مما يمنح مكافأة لكل مهمة؛ والدرجة المُبلَّغ عنها هي نسبة المهام المحلولة (أو متوسط المكافأة).
التحقق
القبول برمجي بالكامل — إذ تقارن البيئة الحالة النهائية (والإجراءات المطلوبة) بالنتيجة المتوقعة دون تقييم بشري، لذا لا تُحتسب المهمة إلا عند تطابق النتيجة.
لماذا يهم
هذا مهم لأن المساعدين الحقيقيين غالبًا لا يستطيعون التصرّف بمفردهم — إذ عليهم إرشاد المستخدم والتنسيق معه — وهذا الإعداد ذو التحكّم المزدوج يكشف إخفاقات التواصل والتنسيق التي تغفلها معايير الأدوات ذات الفاعل الواحد.
مثال محلول
المهمة
τ²-bench، مجال الاتصالات (dual-control): يكتب مستخدم محاكى: «منذ هذا الصباح لا تعمل بيانات الهاتف المحمول لدي، لكن المكالمات والرسائل النصية ما زالت تعمل.» بالاعتماد على وثيقة سياسة المشغّل والأدوات — إضافةً إلى إجراءات الجهاز التي يمكن للمستخدم تنفيذها بنفسه على هاتفه —، وثّق هوية العميل، وشخّص العطل، واستعِد بيانات الهاتف المحمول.
الحل
Correct agent trajectory (telecom tools + user-side device actions): 1. get_customer_by_phone(number); confirm identity via name + DOB. 2. get_line_status(line_id) → "active"; get_network_status(region) → "operational" (rules out account suspension and network outage). 3. Follow the "data down / voice up" branch: user confirms Airplane Mode is OFF, then agent instructs the user to switch "Mobile Data" ON. 4. Verify data is restored; apply NO billing credit (policy forbids a fee/credit for a self-service fix). Resolution → user enables Mobile Data; connectivity restored, account state unchanged.
الشرح
بما أن الصوت والرسائل النصية تعمل بينما البيانات معطّلة على خط active ودون انقطاع في الشبكة، فإن العطل من جهة الجهاز، لذا تحلّه شجرة استكشاف الأعطال في السياسة بإرشاد المستخدم إلى إعادة تفعيل Mobile Data (وتمنع أي رصيد مجاملة مقابل إصلاح ينفّذه المستخدم بنفسه). يمنح τ²-bench مكافأة لكل مهمة (0/1) عبر التحقق من بلوغ البيئة/قاعدة البيانات الحالة النهائية المتوقعة ومن اكتمال جميع الإجراءات المطلوبة والمعلومات التي يجب إبلاغها، ثم يُبلّغ عن الموثوقية عبر تجارب متكررة باستخدام مقياس pass^k.
0 25 50 75 100 2024-10-22 2025-09-14 2026-08-08 Claude 3.5 Sonnet · 69.2 · 2024-10-22 Claude 3.7 Sonnet · 81.2 · 2025-02-24 Kimi K2 · 66.1 · 2025-07-28 Kimi K2 · 66.1 · 2025-07-28 GLM-4.5 · 90.6 · 2025-08-06 GPT-5 · 63.5 · 2025-08-07 GPT‑5 · 96.7 · 2025-08-07 Kimi K2 Thinking · 93 · 2025-11-07 Kimi K2 Thinking · 93 · 2025-11-19 GPT-5.2 Thinking · 98.7 · 2025-12-11 GPT-5.2 Thinking · 98.7 · 2025-12-11 GPT-5.2 Thinking · 98.7 · 2025-12-11 Claude Opus 4.6 · 91.9 · 2026-02-05 Step 3.5 Flash · 88.2 · 2026-02-10 GPT-5.5 · 98 · 2026-04-25 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) · 41.7 · 2026-07-28 Pokee-Isaac 28B · 66.2 · 2026-08-08
Claude 3.5 Sonnet Claude 3.7 Sonnet Kimi K2 GLM-4.5 GPT-5 GPT‑5 Kimi K2 Thinking GPT-5.2 Thinking Claude Opus 4.6 Step 3.5 Flash GPT-5.5 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) Pokee-Isaac 28B
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-08-08 Pokee-Isaac 28B 66.2% Pokee AI تطلق Pokee-Isaac 28B، نموذج سياق بـ 10 ملايين رمز للنشر ضمن الحدود المحددة
2026-07-28 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) 41.69% AgentOmnia يوسع النماذج الوكيلية عبر تطبيقات السيناريو الكامل
2026-04-25 GPT-5.5 98.0% OpenAI تطلق GPT-5.5، نموذج مُعاد تدريبه من الصفر مع معالجة أومني مودال أصلية
2026-02-10 Step 3.5 Flash 88.2% الخطوة 3.5 فلاش: نموذج MoE النشط بـ 11 مليار معلمة يحقق أداءً وكيلاً على المستوى المتقدم
2026-02-05 Claude Opus 4.6 91.9% أنثروبيك تطلق كلاود أوبوس 4.6 بنافذة سياق بـ 1 مليون وتطبيقات عميلية محسّنة
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI تطرح GPT-5.2 بقدرات محسّنة للبرمجة والسياق الطويل والاستدلال
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI تطلق GPT-5.2، متفوقة على Gemini 3 في معايير البرمجة والاستدلال
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI تطرح GPT-5.2 بقدرات عمل معرفي احترافي متقدمة
2025-11-19 Kimi K2 Thinking 93.0% Moonshot AI تطلق Kimi K2 Thinking مع استخدام الأدوات الوكيلية
2025-11-07 Kimi K2 Thinking 93.0% Moonshot AI تطلق Kimi K2 Thinking، نموذج استدلال مفتوح المصدر بـ 1T معلمة
2025-08-07 GPT-5 63.5% OpenAI تطلق GPT-5 الموحّد مع التوجيه في الوقت الفعلي ووصول مجاني
2025-08-07 GPT‑5 96.7% OpenAI تطلق واجهة برمجة تطبيقات GPT-5 بتحسينات في البرمجة والوكلاء
2025-08-06 GLM-4.5 90.6% تشيبو آي تطلق نماذج GLM-4.5 التي توازي كلود وديبسيك
2025-07-28 Kimi K2 66.1% مونشوت تطلق Kimi K2، نموذج MoE مفتوح المصدر للوكلاء بـ 32 مليار معلمة نشطة
2025-07-28 Kimi K2 66.1% كيمي K2: نموذج MoE مفتوح المصدر يحتوي على 1T معلمة ومُحسّن MuonClip
2025-02-24 Claude 3.7 Sonnet 81.2% أنثروبيك تطلق كلاود 3.7 سونيت مع تحكم ديناميكي في التفكير
2024-10-22 Claude 3.5 Sonnet 69.2% أنثروبيك ترقّي نموذج كلاود 3.5 سونيت، وتطلق كلاود 3.5 هايكو وإصدار بيتا لخاصية "استخدام الحاسوب"