Benchmark · agentic
GAIA
يختبر GAIA (General AI Assistant) ما إذا كان بإمكان مساعدي الذكاء الاصطناعي الإجابة على أسئلة واقعية متعددة الخطوات تتطلب استخدام tools وتصفّح الويب والاستدلال عبر مصادر متعددة. الدرجة هي النسبة المئوية للأسئلة التي تمّت الإجابة عليها بشكل صحيح.
اقرأ المزيد
- مثال
- العنصر النموذجي سؤال يبدو يوميًا لكن إجابته مخبّأة عبر عدة خطوات — مثل «البحث عن معلومة في مستند مرتبط ثم دمجها مع بيانات من موقع ويب للوصول إلى إجابة قصيرة واحدة» — ما يتطلّب التصفّح واستخدام tools بدلًا من عملية بحث واحدة.
- طريقة التقييم
- المقياس هو accuracy (الدقة): نسبة الأسئلة التي تطابق إجابتها النهائية الإجابة المتوقعة. لكل سؤال إجابة مرجعية واحدة لا لبس فيها، لذا تكون الإجابة إما صحيحة أو خاطئة.
- التحقق
- تُتحقَّق الإجابات آليًا عبر مطابقة نصية دقيقة (شبه دقيقة) مع الإجابة المرجعية، وتُرسَل نتائج مجموعة الاختبار إلى leaderboard عام تبقى فيه الإجابات الصحيحة سرية.
- لماذا يهم
- يقيس القدرة العملية للمساعد — الجمع بين الاستدلال وتصفّح الويب واستخدام tools في مهام سهلة على البشر لكنها صعبة على الذكاء الاصطناعي — ما يجعله معيارًا شائعًا لوكلاء agents المستقلين.
مثال محلول
المهمة
باستخدام نسخة Wikipedia الإنجليزية الحالية، كم عدد ألبومات الاستوديو التي أصدرتها فرقة Radiohead من عام 1993 حتى عام 2007 ضمناً؟ قدّم عدداً صحيحاً واحداً كإجابة نهائية.
الحل
Albums in range: Pablo Honey (1993), The Bends (1995), OK Computer (1997), Kid A (2000), Amnesiac (2001), Hail to the Thief (2003), In Rainbows (2007) → 7. Final answer: 7
الشرح
أسئلة GAIA لها إجابة مرجعية واحدة لا لبس فيها، يتم الوصول إليها عبر تصفّح الويب مع تجميع بسيط — هنا، عدّ مدخلات قائمة الأعمال ضمن نطاق زمني محدد (تُستبعَد المجموعات المختارة وألبومات الحفلات الحية). ويُقيَّم بأسلوب quasi-exact match: يجب أن تطابق سلسلة الإجابة النهائية بعد التوحيد القياسي المرجع «7» تماماً.