Benchmark · agentic

GAIA

14 نتائج 13 نماذج

يختبر GAIA (General AI Assistant) ما إذا كان بإمكان مساعدي الذكاء الاصطناعي الإجابة على أسئلة واقعية متعددة الخطوات تتطلب استخدام tools وتصفّح الويب والاستدلال عبر مصادر متعددة. الدرجة هي النسبة المئوية للأسئلة التي تمّت الإجابة عليها بشكل صحيح.

اقرأ المزيد
مثال
العنصر النموذجي سؤال يبدو يوميًا لكن إجابته مخبّأة عبر عدة خطوات — مثل «البحث عن معلومة في مستند مرتبط ثم دمجها مع بيانات من موقع ويب للوصول إلى إجابة قصيرة واحدة» — ما يتطلّب التصفّح واستخدام tools بدلًا من عملية بحث واحدة.
طريقة التقييم
المقياس هو accuracy (الدقة): نسبة الأسئلة التي تطابق إجابتها النهائية الإجابة المتوقعة. لكل سؤال إجابة مرجعية واحدة لا لبس فيها، لذا تكون الإجابة إما صحيحة أو خاطئة.
التحقق
تُتحقَّق الإجابات آليًا عبر مطابقة نصية دقيقة (شبه دقيقة) مع الإجابة المرجعية، وتُرسَل نتائج مجموعة الاختبار إلى leaderboard عام تبقى فيه الإجابات الصحيحة سرية.
لماذا يهم
يقيس القدرة العملية للمساعد — الجمع بين الاستدلال وتصفّح الويب واستخدام tools في مهام سهلة على البشر لكنها صعبة على الذكاء الاصطناعي — ما يجعله معيارًا شائعًا لوكلاء agents المستقلين.
مثال محلول
المهمة
باستخدام نسخة Wikipedia الإنجليزية الحالية، كم عدد ألبومات الاستوديو التي أصدرتها فرقة Radiohead من عام 1993 حتى عام 2007 ضمناً؟ قدّم عدداً صحيحاً واحداً كإجابة نهائية.
الحل
Albums in range: Pablo Honey (1993), The Bends (1995), OK Computer (1997), Kid A (2000), Amnesiac (2001), Hail to the Thief (2003), In Rainbows (2007) → 7. Final answer: 7
الشرح
أسئلة GAIA لها إجابة مرجعية واحدة لا لبس فيها، يتم الوصول إليها عبر تصفّح الويب مع تجميع بسيط — هنا، عدّ مدخلات قائمة الأعمال ضمن نطاق زمني محدد (تُستبعَد المجموعات المختارة وألبومات الحفلات الحية). ويُقيَّم بأسلوب quasi-exact match: يجب أن تطابق سلسلة الإجابة النهائية بعد التوحيد القياسي المرجع «7» تماماً.
0 23 46 69 92 2024-09-27 2025-09-03 2026-08-10 Trase · 35.5 · 2024-09-27 Trase · 67 · 2025-02-21 Enterprise h2oGPTe Agent · 65 · 2024-12-23 Deep Research · 67.4 · 2025-02-04 our agent · 55.1 · 2025-02-04 OpenAI Deep Research · 72.6 · 2025-02-21 OWL · 69.1 · 2025-03-07 Manus AI · 86.5 · 2025-03-10 h2oGPTe Agent · 75 · 2025-03-17 Alita · 75.2 · 2025-05-26 ALITA-G · 83.0 · 2025-10-27 MiroThinker v1.0 (72B variant) · 81.9 · 2025-11-14 Agents-A1 · 46.4 · 2026-07-06 Muse Glimmer · 43.3 · 2026-08-10
Trase Enterprise h2oGPTe Agent Deep Research our agent OpenAI Deep Research OWL Manus AI h2oGPTe Agent Alita ALITA-G MiroThinker v1.0 (72B variant) Agents-A1 Muse Glimmer
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-08-10 Muse Glimmer 43.3% إطلاق ميتا لـ Muse Glimmer، نموذج وكيل بوزن مفتوح يتكون من 30 مليار معلمة ويعمل على بطاقة رسوميات استهلاكية واحدة
2026-07-06 Agents-A1 46.4pts توسيع الأفق وليس المعلمات: بلوغ أداء النليون مع وكيل بحجم 35 مليار
2025-11-14 MiroThinker v1.0 (72B variant) 81.9% MiroThinker v1.0 يقدم القياس التفاعلي لوكلاء البحث مفتوحة المصدر
2025-10-27 ALITA-G 83.03% تقوم ALITA-G بتطور وكلائها ذاتياً من خلال توليد وتنظيم أدوات MCP
2025-05-26 Alita 75.15% تُمكّن أليتا من الاستدلال الوكيل القابل للتوسع بأقل قدر ممكن من التعريف المسبق وأقصى حد من التطور الذاتي
2025-03-17 h2oGPTe Agent 75.0% وكيل h2oGPTe التابع لشركة H2O.ai يتصدر معيار GAIA بدقة تصل إلى 75%
2025-03-10 Manus AI 86.5% إطلاق Manus AI كوكيل مستقل مع نتائج معيار GAIA
2025-03-07 OWL 69.09% OWL يحقق المركز الأول في معيار GAIA بنتيجة 69.09%
2025-02-21 Trase 67.0% تراسي تتصدر قائمة GAIA بنتيجة اختبار 67% بتكلفة 1/100
2025-02-21 OpenAI Deep Research 72.57% تراسي تتصدر قائمة GAIA بنتيجة اختبار 67% بتكلفة 1/100
2025-02-04 Deep Research 67.36% إعادة إنتاج نظام DeepResearch مفتوح المصدر تحقق 55.15% على GAIA باستخدام smolagents
2025-02-04 our agent 55.15% إعادة إنتاج نظام DeepResearch مفتوح المصدر تحقق 55.15% على GAIA باستخدام smolagents
2024-12-23 Enterprise h2oGPTe Agent 65.0% وكيل h2oGPTe من H2O.ai يتصدر قائمة معايير GAIA بنتيجة 65%
2024-09-27 Trase 35.55% تراسي تتصدر قائمة GAIA في Hugging Face بمعدل نجاح 35.55%