Benchmark · agentic
BrowseComp
BrowseComp هو معيار من OpenAI لوكلاء الذكاء الاصطناعي الذين يتصفّحون الويب، يختبر قدرتهم على تعقّب حقائق يصعب العثور عليها ومبعثرة عبر الإنترنت. وتُعرض النتيجة كنسبة مئوية من الأسئلة المُجاب عنها بشكل صحيح.
اقرأ المزيد
- مثال
- يطرح السؤال النموذجي مسألة إجابتها الواقعية القصيرة — اسم أو تاريخ أو رقم — مدفونة في أعماق الويب وتتطلّب بحثًا دؤوبًا متعدّد الخطوات عبر صفحات كثيرة للعثور عليها.
- طريقة التقييم
- المقياس هو الدقة (accuracy): نسبة الأسئلة التي تطابق فيها إجابة الوكيل الإجابة الصحيحة الوحيدة المعروفة.
- التحقق
- تُقبل الإجابة عندما تطابق الإجابة المرجعية المحدّدة مسبقًا (بأسلوب المطابقة التامّة)؛ وتُصاغ الأسئلة بحيث يصعب إيجاد إجابتها لكن يسهل التحقّق منها بمجرد تقديمها.
- لماذا يهم
- يقيس مهارة تفتقر إليها روبوتات الدردشة العادية — بحثًا عميقًا ودؤوبًا في الويب عبر خطوات كثيرة — لذا يظل اختبارًا صعبًا للتصفّح الوكيلي حتى بالنسبة للنماذج القوية.
مثال محلول
المهمة
بند BrowseComp: «اذكر فيلمًا روائيًا طويلًا صدر بين عامي 2010 و2015 بحيث (1) فاز بجائزة الأوسكار لأفضل فيلم، و(2) يجسّد عملية إنقاذ سرّية واحدة، و(3) أخرجه الشخص نفسه الذي يؤدي الدور الرئيسي، و(4) تبلغ ذروته في مطار بطهران. اذكر عنوان الفيلم فقط.»
الحل
تتقاطع القيود عند فيلم واحد — فائز بجائزة الأوسكار لأفضل فيلم في الفترة 2010–2015، وهو دراما إنقاذ سرّية أخرجها بطلها نفسه وتبلغ ذروتها في مطار بطهران. الإجابة النهائية: Argo (2012)، إخراج وبطولة Ben Affleck.
الشرح
كل دليل يقلّص مجموعة المرشحين — الفائزون بجائزة أفضل فيلم بين 2010–2015، ثم أفلام الإنقاذ التي أخرجها بطلها، وأخيرًا الفيلم الذي تبلغ ذروته في مطار طهران — فلا يبقى سوى Argo، الذي أخرجه Ben Affleck ومثّل بطولته. يقارن BrowseComp إجابة نصية قصيرة حرة بالمرجع عبر مطابقة تامة أو مدقّقة بنموذج، لذا تُحتسب «Argo» صحيحة.