قام أحد المستخدمين بتقييم نموذج Ox Alpha على مجموعة بيانات SWE-bench Verified-Mini، محققاً معدل حل بنسبة 96% (48 من أصل 50 مهمة) باستخدام الهيكل الأساسي mini-swe-agent الرسمي. أُجريت التقييمات محلياً باستخدام إطار عمل Docker الرسمي لـ SWE-bench، حيث تُعتبر المهمة محلولة فقط إذا نجحت جميع اختبارات FAIL_TO_PASS وPASS_TO_PASS.

  • النموذج: Ox Alpha مُقدَّم عبر بوابة Go الخاصة بـ opencode.
  • الهيكل الأساسي: mini-swe-agent v2.4.6 (هيكل قائمة المتصدرين الرسمية المعتمدة على Bash فقط).
  • مجموعة البيانات: swe-bench-verified-mini، وهي مجموعة فرعية مكونة من 50 مهمة تحتوي فقط على مستودعات django وsphinx.
  • النتائج: تم حل 48/50 مهمة، مع فشل في django__django-11790 وdjango__django-11815؛ متوسط 40 خطوة لكل مهمة.
  • المقارنة: تتجاوز النتيجة نسبة 95% التي حققها Claude Fable 5 على نفس المجموعة الفرعية، رغم أن المؤلف يشير إلى أن ذلك قد يكون مبالغاً فيه بسبب الحفظ أو صغر حجم مجموعة البيانات وسهولتها.

يُعتبر المؤلف هذه النتيجة مرتفعة بشكل مشكوك فيه لنموذج من الطبقة المجانية، وينصح بمعاملة الرقم 96% كحد أعلى بدلاً من اعتباره معياراً قابلاً للمقارنة مع النماذج التي خضعت للاختبار على المجموعة الكاملة المكونة من 500 مهمة.