एक उपयोगकर्ता ने Ox Alpha मॉडल का परीक्षण SWE-bench Verified-Mini डेटासेट पर किया, जिसमें आधिकारिक mini-swe-agent स्केफोल्ड का उपयोग करके 96% निष्पादन दर (50 में से 48 कार्य) प्राप्त हुई। मूल्यांकन आधिकारिक SWE-bench Docker हार्नेस के साथ स्थानीय रूप से किया गया, जहाँ एक कार्य को तभी हल माना जाता है जब सभी FAIL_TO_PASS और PASS_TO_PASS परीक्षण सफल होते हैं।

  • मॉडल: opencode के Go गेटवे के माध्यम से Ox Alpha।
  • स्केफोल्ड: mini-swe-agent v2.4.6 (Bash-Only आधिकारिक लीडरबोर्ड स्केफोल्ड)।
  • डेटासेट: swe-bench-verified-mini, जो केवल django और sphinx रिपॉजिटरी वाले 50-कार्य वाले उपसमुच्चय को दर्शाता है।
  • परिणाम: 48/50 हल किए गए, django__django-11790 और django__django-11815 में विफलता; प्रति कार्य औसतन 40 चरण।
  • तुलना: यही स्कोर उसी उपसमुच्चय पर Claude Fable 5 के 95% से अधिक है, हालाँकि लेखक ने नोट किया है कि यह मेमोराइजेशन या छोटे और आसान डेटासेट के कारण बढ़ा हुआ हो सकता है।

लेखक इस परिणाम को एक मुफ्त-स्तरीय मॉडल के लिए संदिग्ध रूप से उच्च मानते हैं और 96% की संख्या को पूर्ण 500-कार्य वाले सेट पर परीक्षित मॉडलों के खिलाफ तुलनात्मक बेंचमार्क के बजाय एक ऊपरी सीमा के रूप में मानने की सलाह देते हैं।