أطلقت OpenAI مجموعة SWE-bench Verified، وهي مجموعة فرعية مُتحقق منها من قبل البشر ضمن معيار SWE-bench، صُمّمت لتقييم قدرة نماذج الذكاء الاصطناعي على حل المشكلات البرمجية الواقعية بشكل أكثر موثوقية. تحل هذه النسخة الجديدة محل مجموعات الاختبار الأصلية SWE-bench وSWE-bench Lite من خلال معالجة العيوب التي كانت تؤدي سابقًا إلى التقليل من قدرات النماذج.
تشمل الإصدار 500 عينة تم التحقق منها من قبل مطورين محترفين لضمان وصف دقيق للمشكلات واختبارات وحدات ذات نطاق مناسب. كما توفر تسميات توضيحية لجميع عناصر الاختبار الـ 1,699، مما يتيح تقسيم الصعوبة إلى مجموعات فرعية "سهلة" (196 مهمة) و"صعبة" (45 مهمة). بالإضافة إلى ذلك، تم إطلاق إطار تقييم جديد يستخدم بيئات Docker الحاوية لتحسين موثوقية الإعداد.
على SWE-bench Verified، يحل GPT-4o نسبة 33.2% من العينات، بينما يضاعف أفضل هيكل مفتوح المصدر، وهو Agentless، نتيجته السابقة إلى 16%.