Benchmark · agentic

OSWorld

28 نتائج 22 نماذج

OSWorld هو معيار (benchmark) يختبر وكلاء استخدام الحاسوب على مهام حقيقية لنظام تشغيل مكتبي تشمل تطبيقات يومية (مديرو الملفات، متصفحات الويب، حِزم المكتب). ويُبلّغ عن النسبة المئوية للمهام التي يكملها الوكيل بنجاح.

اقرأ المزيد
مثال
قد تطلب مهمة من الوكيل فتح جدول بيانات وتعديل قيمة أو إعادة تنسيق بيانات وحفظ الملف، أو العثور على ملف في مدير الملفات وتغيير إعداد في النظام، مع تشغيل الواجهة الرسومية (GUI) الحقيقية تمامًا كما يفعل الإنسان.
طريقة التقييم
المقياس هو معدل نجاح المهام (task success rate) معبَّرًا عنه بالنسبة المئوية. كل مهمة إما تنجح أو تفشل، والدرجة هي نسبة المهام الناجحة عبر مجموعة المهام كاملة.
التحقق
تُفحص النتائج تلقائيًا بواسطة نصوص برمجية قائمة على التنفيذ تفحص الحالة النهائية للجهاز (مثلاً، هل أصبح الملف أو القيمة أو الإعداد الصحيح موجودًا الآن)، بدلاً من مطابقة النص أو تصويت البشر.
لماذا يهم
يقيس ما إذا كان بإمكان وكلاء الذكاء الاصطناعي تشغيل حاسوب حقيقي فعليًا عبر تطبيقات متعددة — وهو اختبار للاستقلالية أصعب وأكثر واقعية بكثير من الإجابة عن الأسئلة أو مهام تطبيق واحد.
مثال محلول
المهمة
توجد نافذة GNOME Terminal مفتوحة على سطح مكتب Ubuntu. في المجلد ~/project، ابحث بشكل تكراري عن كل ملفات .log التي يزيد حجمها عن 10 MB واحذفها، مع ترك بقية الملفات دون مساس.
الحل
find ~/project -type f -name '*.log' -size +10M -delete
الشرح
يتنقّل find بشكل تكراري داخل ~/project، ويختار الملفات العادية المسمّاة *.log التي يزيد حجمها عن 10 MB، ويحذف -delete هذه الملفات وحدها دون المساس بالبقية. يقيّم OSWorld باستخدام مدقّق خاص بكل مهمة على الحالة النهائية لنظام ملفات الآلة الافتراضية (VM)، ويمنح reward 1 فقط إذا اختفت ملفات logs المستهدفة وبقيت الملفات الأخرى.
0 24 48 72 96 2024-04-11 2025-06-11 2026-08-11 best model · 12.2 · 2024-04-11 Claude 3.5 Sonnet (New) · 14.9 · 2024-10-22 Claude 3.5 Sonnet · 14.9 · 2024-10-22 UI-TARS · 24.6 · 2025-01-21 CUA · 38.1 · 2025-01-23 GUI-Owl-7B · 29.4 · 2025-08-21 Mobile-Agent-v3 · 37.7 · 2025-08-21 GUI-Owl (with TRPO) · 34.9 · 2025-08-21 UI-TARS-2 · 47.5 · 2025-09-02 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-30 Surfer 2 · 60.1 · 2025-10-22 Claude Opus 4.6 · 72.7 · 2026-02-05 Claude Sonnet 4.6 · 72.5 · 2026-02-17 GUI-Owl-1.5 · 56.5 · 2026-02-24 GPT-5.5 · 78.7 · 2026-04-25 OpenCUA-72B · 48.9 · 2026-07-06 GPT-5.6 Sol · 62.6 · 2026-07-09 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-27 Muse Glimmer · 65.9 · 2026-08-10 Opus 5 · 90.7 · 2026-08-11
best model Claude 3.5 Sonnet (New) Claude 3.5 Sonnet UI-TARS CUA GUI-Owl-7B Mobile-Agent-v3 GUI-Owl (with TRPO) UI-TARS-2 Claude Sonnet 4.5 Surfer 2 Claude Opus 4.6 Claude Sonnet 4.6 GUI-Owl-1.5 GPT-5.5 OpenCUA-72B GPT-5.6 Sol Gemini 3.6 Flash Gemini 3.5 Flash-Lite OpenForgeGUI Muse Glimmer Opus 5
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-08-11 Opus 5 90.69% وكيل Ouroboros ذاتي التطوير يضرب أرقامًا قياسية جديدة مع Opus 5
2026-08-10 Muse Glimmer 65.9% إطلاق ميتا لـ Muse Glimmer، نموذج وكيل بوزن مفتوح يتكون من 30 مليار معلمة ويعمل على بطاقة رسوميات استهلاكية واحدة
2026-07-27 OpenForgeGUI 37.7% يمكّن OpenForgeRL التدريب الشامل للوكلاء المعتمدين على أدوات في أي بيئة
2026-07-24 OpenForgeGUI 37.7% يمكن لـ OpenForgeRL تدريب الوكلاء المعتمدين على أدوات الاستشعار بشكل متكامل في أي بيئة
2026-07-24 OpenForgeGUI 37.7% يمكّن OpenForgeRL التدريب الشامل للوكلاء المعتمدين على أدوات في أي بيئة
2026-07-21 Gemini 3.5 Flash-Lite 74.0% جوجل تطلق نماذج جيميناي 3.6 فلاش، و3.5 فلاش-لايت، و3.5 فلاش سايبير لأعباء العمل الوكيلية
2026-07-21 Gemini 3.6 Flash 83.0% جوجل تطلق نماذج جيميناي 3.6 فلاش، و3.5 فلاش-لايت، و3.5 فلاش سايبير لأعباء العمل الوكيلية
2026-07-21 Gemini 3.6 Flash 83.0% جوجل تطلق جيميني 3.6 فلاش، و3.5 فلاش-لايت، و3.5 فلاش سايبير
2026-07-21 Gemini 3.5 Flash-Lite 74.0% جوجل تطلق جيميني 3.6 فلاش، و3.5 فلاش-لايت، و3.5 فلاش سايبير
2026-07-09 GPT-5.6 Sol 62.6% OpenAI تطلق عائلة GPT-5.6 بموديلات Sol و Terra و Luna
2026-07-06 OpenCUA-72B 48.9% التعلم من الفشل: التحسين الذاتي أثناء الاستدلال لوكلاء استخدام الحاسوب
2026-04-25 GPT-5.5 78.7% OpenAI تطلق GPT-5.5، نموذج مُعاد تدريبه من الصفر مع معالجة أومني مودال أصلية
2026-02-24 GUI-Owl-1.5 56.5% GUI-Owl-1.5 يقدم وكلاء واجهة مستخدم رسومية أساسية عبر منصات متعددة
2026-02-17 Claude Sonnet 4.6 72.5% أنثروبيك تطلق كلاود سونيت 4.6 مع تحسينات في البرمجة واستخدام الكمبيوتر وسياق يتكون من مليون توكن
2026-02-05 Claude Opus 4.6 72.7% أنثروبيك تطلق كلاود أوبوس 4.6 بنافذة سياق بـ 1 مليون وتطبيقات عميلية محسّنة
2025-10-22 Surfer 2 60.1% Surfer 2 يحقق استخدامًا للكمبيوتر عبر المنصات بأعلى مستوى من الأداء عبر الملاحظة البصرية
2025-09-30 Claude Sonnet 4.5 61.4% أنثروبيك تطلق كلود سونيت 4.5 بقدرات برمجة ووكيل محسّنة
2025-09-29 Claude Sonnet 4.5 61.4% أنثروبيك تطلق كلاود سونيت 4.5 مع تحسينات في البرمجة واستخدام الحاسوب والمحاذاة
2025-09-29 Claude Sonnet 4.5 61.4% Anthropic
2025-09-02 UI-TARS-2 47.5% UI-TARS-2 يتقدم في وكلاء واجهة المستخدم الرسومية باستخدام التعلم التعزيزي متعدد الأدوار
2025-08-21 GUI-Owl-7B 29.4% Mobile-Agent-v3 يقدم GUI-Owl، محققاً رقماً قياسياً جديداً مفتوح المصدر على AndroidWorld وOSWorld
2025-08-21 Mobile-Agent-v3 37.7% Mobile-Agent-v3 يقدم GUI-Owl، محققاً رقماً قياسياً جديداً مفتوح المصدر على AndroidWorld وOSWorld
2025-08-21 GUI-Owl (with TRPO) 34.9% Mobile-Agent-v3 يقدم GUI-Owl، محققاً رقماً قياسياً جديداً مفتوح المصدر على AndroidWorld وOSWorld
2025-01-23 CUA 38.1% OpenAI تقدم وكيل استخدام الحاسوب (CUA) الذي يدعم البحث التجريبي لـ Operator
2025-01-21 UI-TARS 24.6% UI-TARS يُقدّم نموذج وكيل واجهة مستخدم أصلي يتفوق على الأطر التجارية
2024-10-22 Claude 3.5 Sonnet (New) 14.9% أنثروبيك تطلق كلاود 3.5 هايكو وكلاود 3.5 سونيت المطور مع ميزة استخدام الحاسوب
2024-10-22 Claude 3.5 Sonnet 14.9% أنثروبيك ترقّي نموذج كلاود 3.5 سونيت، وتطلق كلاود 3.5 هايكو وإصدار بيتا لخاصية "استخدام الحاسوب"
2024-04-11 best model 12.24% OSWorld يقدم معيارًا للوكلاء متعدد الوسائط في بيئات الحاسوب الحقيقية