يقدم الورقة SWE-bench، وهو إطار تقييم مصمم لاختبار قدرات نماذج اللغات في مهام هندسة البرمجيات الواقعية. يتكون من 2,294 مشكلة مستخرجة من قضايا وطلبات سحب حقيقية على GitHub عبر 12 مستودع Python شائع.

  • يتطلب المعيار أن تقوم النماذج بتعديل قواعد الشفرة لحل مشكلات محددة، وغالبًا ما يتضمن ذلك تنسيقًا عبر وظائف متعددة وفئات وملفات.
  • يجب على النماذج التفاعل مع بيئات التنفيذ، ومعالجة سياقات طويلة للغاية، وإجراء استدلالات معقدة تتجاوز توليد الكود التقليدي.
  • تظهر التقييمات أن حتى النماذج المملوكة الأكثر تقدمًا تواجه صعوبات كبيرة؛ حيث حل أفضل نموذج أداءً، Claude 2، فقط 1.96% من القضايا.
  • كما لم يحل النموذج المُضبط SWE-Llama سوى أبسط القضايا داخل مجموعة البيانات.

تُعتبر التقدم على SWE-bench خطوات نحو جعل نماذج اللغات أكثر عملية وذكية ومستقلة في السيناريوهات الواقعية.