يقدم الورقة SWE-bench، وهو إطار تقييم مصمم لاختبار قدرات نماذج اللغات في مهام هندسة البرمجيات الواقعية. يتكون من 2,294 مشكلة مستخرجة من قضايا وطلبات سحب حقيقية على GitHub عبر 12 مستودع Python شائع.
- يتطلب المعيار أن تقوم النماذج بتعديل قواعد الشفرة لحل مشكلات محددة، وغالبًا ما يتضمن ذلك تنسيقًا عبر وظائف متعددة وفئات وملفات.
- يجب على النماذج التفاعل مع بيئات التنفيذ، ومعالجة سياقات طويلة للغاية، وإجراء استدلالات معقدة تتجاوز توليد الكود التقليدي.
- تظهر التقييمات أن حتى النماذج المملوكة الأكثر تقدمًا تواجه صعوبات كبيرة؛ حيث حل أفضل نموذج أداءً، Claude 2، فقط 1.96% من القضايا.
- كما لم يحل النموذج المُضبط SWE-Llama سوى أبسط القضايا داخل مجموعة البيانات.
تُعتبر التقدم على SWE-bench خطوات نحو جعل نماذج اللغات أكثر عملية وذكية ومستقلة في السيناريوهات الواقعية.