Benchmark · agentic

BrowseComp

26 نتائج 23 نماذج

BrowseComp هو معيار من OpenAI لوكلاء الذكاء الاصطناعي الذين يتصفّحون الويب، يختبر قدرتهم على تعقّب حقائق يصعب العثور عليها ومبعثرة عبر الإنترنت. وتُعرض النتيجة كنسبة مئوية من الأسئلة المُجاب عنها بشكل صحيح.

اقرأ المزيد
مثال
يطرح السؤال النموذجي مسألة إجابتها الواقعية القصيرة — اسم أو تاريخ أو رقم — مدفونة في أعماق الويب وتتطلّب بحثًا دؤوبًا متعدّد الخطوات عبر صفحات كثيرة للعثور عليها.
طريقة التقييم
المقياس هو الدقة (accuracy): نسبة الأسئلة التي تطابق فيها إجابة الوكيل الإجابة الصحيحة الوحيدة المعروفة.
التحقق
تُقبل الإجابة عندما تطابق الإجابة المرجعية المحدّدة مسبقًا (بأسلوب المطابقة التامّة)؛ وتُصاغ الأسئلة بحيث يصعب إيجاد إجابتها لكن يسهل التحقّق منها بمجرد تقديمها.
لماذا يهم
يقيس مهارة تفتقر إليها روبوتات الدردشة العادية — بحثًا عميقًا ودؤوبًا في الويب عبر خطوات كثيرة — لذا يظل اختبارًا صعبًا للتصفّح الوكيلي حتى بالنسبة للنماذج القوية.
مثال محلول
المهمة
بند BrowseComp: «اذكر فيلمًا روائيًا طويلًا صدر بين عامي 2010 و2015 بحيث (1) فاز بجائزة الأوسكار لأفضل فيلم، و(2) يجسّد عملية إنقاذ سرّية واحدة، و(3) أخرجه الشخص نفسه الذي يؤدي الدور الرئيسي، و(4) تبلغ ذروته في مطار بطهران. اذكر عنوان الفيلم فقط.»
الحل
تتقاطع القيود عند فيلم واحد — فائز بجائزة الأوسكار لأفضل فيلم في الفترة 2010–2015، وهو دراما إنقاذ سرّية أخرجها بطلها نفسه وتبلغ ذروتها في مطار بطهران. الإجابة النهائية: Argo (2012)، إخراج وبطولة Ben Affleck.
الشرح
كل دليل يقلّص مجموعة المرشحين — الفائزون بجائزة أفضل فيلم بين 2010–2015، ثم أفلام الإنقاذ التي أخرجها بطلها، وأخيرًا الفيلم الذي تبلغ ذروته في مطار طهران — فلا يبقى سوى Argo، الذي أخرجه Ben Affleck ومثّل بطولته. يقارن BrowseComp إجابة نصية قصيرة حرة بالمرجع عبر مطابقة تامة أو مدقّقة بنموذج، لذا تُحتسب «Argo» صحيحة.
0 24.5 49 73.5 98 2025-04-10 2025-12-11 2026-08-13 GLM-4.5 · 26.4 · 2025-08-06 Tongyi DeepResearch · 43.4 · 2025-09-16 Kimi K2 Thinking · 60.2 · 2025-11-07 MiroThinker v1.0 (72B variant) · 47.1 · 2025-11-14 Kimi K2.5 · 74.9 · 2026-01-27 Claude Opus 4.6 · 84 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-03-06 Step 3.5 Flash · 69 · 2026-02-10 Qwen3.5-397B-A17B · 78.6 · 2026-02-16 Opus 4.6 · 84 · 2026-04-21 GPT-5.4 · 82.7 · 2026-04-21 GPT-5.4 Pro · 89.3 · 2026-04-21 Gemini 3.1 Pro · 85.9 · 2026-04-23 GPT-5.5 · 84.4 · 2026-04-23 Agents-A1 · 75.5 · 2026-07-06 GPT-5.6 Sol · 92.2 · 2026-07-09 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Qwen3-4B · 35.6 · 2026-07-16 Qwen3-30B-A3B · 42.6 · 2026-07-16 GPT-Live-1 · 75.2 · 2026-07-17 Kimi K3 · 91.2 · 2026-07-17 GPT-5.6 Luna (Extra High) · 84.0 · 2026-08-13 GPT-5.5 (Extra High) · 84.4 · 2026-08-13 OpenAI Deep Research · 51.5 · 2025-04-10
GLM-4.5 Tongyi DeepResearch Kimi K2 Thinking MiroThinker v1.0 (72B variant) Kimi K2.5 Claude Opus 4.6 Step 3.5 Flash Qwen3.5-397B-A17B Opus 4.6 GPT-5.4 GPT-5.4 Pro Gemini 3.1 Pro GPT-5.5 Agents-A1 GPT-5.6 Sol Mach-Mind-4-Flash Qwen3-4B Qwen3-30B-A3B GPT-Live-1 Kimi K3 GPT-5.6 Luna (Extra High) GPT-5.5 (Extra High) OpenAI Deep Research
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-08-13 GPT-5.6 Luna (Extra High) 84.04% OpenAI تطلق GPT-5.6 لسير عمل وكيلي فعال من حيث التكلفة وعالي الأداء
2026-08-13 GPT-5.5 (Extra High) 84.36% OpenAI تطلق GPT-5.6 لسير عمل وكيلي فعال من حيث التكلفة وعالي الأداء
2026-07-17 Kimi K3 91.2% مونشوت آي إيه تطلق كيمي كي3، نموذج MoE مفتوح المصدر بـ 2.8 تريليون معلمة وسياق يصل إلى مليون رمز
2026-07-17 GPT-Live-1 75.2% OpenAI تطلق نماذج صوتية ثنائية الاتجاه ومحكمة ألمانية تحاسب جوجل على ملخصات الذكاء الاصطناعي
2026-07-16 Qwen3-4B 35.6% يحسّن TRACE استخدام الأدوات لدى الوكلاء طويلي المدى عبر تقدير الائتمان على مستوى الدور
2026-07-16 Qwen3-30B-A3B 42.6% يحسّن TRACE استخدام الأدوات لدى الوكلاء طويلي المدى عبر تقدير الائتمان على مستوى الدور
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash: نموذج وكيل MoE بحجم 35 مليار معادل للنماذج الأكبر عبر تحسين ما بعد التدريب
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash: نموذج MoE الوكيل بـ 35 مليار معلمة يساوي النماذج الأكبر عبر تحسين ما بعد التدريب
2026-07-09 GPT-5.6 Sol 92.2% OpenAI تطلق عائلة GPT-5.6 بموديلات Sol و Terra و Luna
2026-07-06 Agents-A1 75.5pts توسيع الأفق وليس المعلمات: بلوغ أداء النليون مع وكيل بحجم 35 مليار
2026-04-23 Gemini 3.1 Pro 85.9% OpenAI تطلق GPT-5.5 بقدرات وكيلية ومضاعفة أسعار واجهة برمجة التطبيقات
2026-04-23 GPT-5.5 84.4% OpenAI تطلق GPT-5.5 بقدرات وكيلية ومضاعفة أسعار واجهة برمجة التطبيقات
2026-04-21 Opus 4.6 84.0% جوجل تطلق وكلاء Deep Research وDeep Research Max المبنية على Gemini 3.1 Pro
2026-04-21 GPT-5.4 82.7% جوجل تطلق وكلاء Deep Research وDeep Research Max المبنية على Gemini 3.1 Pro
2026-04-21 GPT-5.4 Pro 89.3% جوجل تطلق وكلاء Deep Research وDeep Research Max المبنية على Gemini 3.1 Pro
2026-03-06 Claude Opus 4.6 83.73% أنثروبيك تطلق بطاقة نظام كلاود أوبس 4.6 مفصلة القدرات وتقييمات السلامة
2026-02-16 Qwen3.5-397B-A17B 78.6% Qwen تطلق نموذج Qwen3.5-397B-A17B المُكمَّم بـ FP8
2026-02-10 Step 3.5 Flash 69.0% الخطوة 3.5 فلاش: نموذج MoE النشط بـ 11 مليار معلمة يحقق أداءً وكيلاً على المستوى المتقدم
2026-02-05 Claude Opus 4.6 84.0% أنثروبيك تطلق كلاود أوبوس 4.6 بنافذة سياق بـ 1 مليون وتطبيقات عميلية محسّنة
2026-02-05 Claude Opus 4.6 83.73% أنثروبيك تنشر بطاقة نظام كلاود أوبوس 4.6 بتفاصيل القدرات وتقييمات السلامة
2026-01-27 Kimi K2.5 74.9% مونشوت تطلق Kimi K2.5 بتقنية Agent Swarm
2025-11-14 MiroThinker v1.0 (72B variant) 47.1% MiroThinker v1.0 يقدم القياس التفاعلي لوكلاء البحث مفتوحة المصدر
2025-11-07 Kimi K2 Thinking 60.2% Moonshot AI تطلق Kimi K2 Thinking، نموذج استدلال مفتوح المصدر بـ 1T معلمة
2025-09-16 Tongyi DeepResearch 43.4% تونغي تطلق DeepResearch، وكيل ويب مفتوح المصدر يعادل الأداء الخاص
2025-08-06 GLM-4.5 26.4% تشيبو آي تطلق نماذج GLM-4.5 التي توازي كلود وديبسيك
2025-04-10 OpenAI Deep Research 51.5% OpenAI