Benchmark · agentic
OSWorld
OSWorld هو معيار (benchmark) يختبر وكلاء استخدام الحاسوب على مهام حقيقية لنظام تشغيل مكتبي تشمل تطبيقات يومية (مديرو الملفات، متصفحات الويب، حِزم المكتب). ويُبلّغ عن النسبة المئوية للمهام التي يكملها الوكيل بنجاح.
اقرأ المزيد
- مثال
- قد تطلب مهمة من الوكيل فتح جدول بيانات وتعديل قيمة أو إعادة تنسيق بيانات وحفظ الملف، أو العثور على ملف في مدير الملفات وتغيير إعداد في النظام، مع تشغيل الواجهة الرسومية (GUI) الحقيقية تمامًا كما يفعل الإنسان.
- طريقة التقييم
- المقياس هو معدل نجاح المهام (task success rate) معبَّرًا عنه بالنسبة المئوية. كل مهمة إما تنجح أو تفشل، والدرجة هي نسبة المهام الناجحة عبر مجموعة المهام كاملة.
- التحقق
- تُفحص النتائج تلقائيًا بواسطة نصوص برمجية قائمة على التنفيذ تفحص الحالة النهائية للجهاز (مثلاً، هل أصبح الملف أو القيمة أو الإعداد الصحيح موجودًا الآن)، بدلاً من مطابقة النص أو تصويت البشر.
- لماذا يهم
- يقيس ما إذا كان بإمكان وكلاء الذكاء الاصطناعي تشغيل حاسوب حقيقي فعليًا عبر تطبيقات متعددة — وهو اختبار للاستقلالية أصعب وأكثر واقعية بكثير من الإجابة عن الأسئلة أو مهام تطبيق واحد.
مثال محلول
المهمة
توجد نافذة GNOME Terminal مفتوحة على سطح مكتب Ubuntu. في المجلد ~/project، ابحث بشكل تكراري عن كل ملفات .log التي يزيد حجمها عن 10 MB واحذفها، مع ترك بقية الملفات دون مساس.
الحل
find ~/project -type f -name '*.log' -size +10M -delete
الشرح
يتنقّل find بشكل تكراري داخل ~/project، ويختار الملفات العادية المسمّاة *.log التي يزيد حجمها عن 10 MB، ويحذف -delete هذه الملفات وحدها دون المساس بالبقية. يقيّم OSWorld باستخدام مدقّق خاص بكل مهمة على الحالة النهائية لنظام ملفات الآلة الافتراضية (VM)، ويمنح reward 1 فقط إذا اختفت ملفات logs المستهدفة وبقيت الملفات الأخرى.