Makalah ini memperkenalkan SWE-bench, sebuah kerangka evaluasi yang dirancang untuk menguji kemampuan model bahasa pada tugas rekayasa perangkat lunak dunia nyata. Ini terdiri dari 2.294 masalah yang diambil dari issue dan pull request GitHub asli di 12 repositori Python populer.
- Benchmark ini mengharuskan model untuk mengedit basis kode guna menyelesaikan masalah tertentu, sering kali melibatkan koordinasi lintas beberapa fungsi, kelas, dan file.
- Model harus berinteraksi dengan lingkungan eksekusi, memproses konteks yang sangat panjang, dan melakukan penalaran kompleks di luar generasi kode tradisional.
- Evaluasi menunjukkan bahwa bahkan model proprietaris tercanggih pun mengalami kesulitan signifikan; model dengan kinerja terbaik, Claude 2, hanya menyelesaikan 1,96% dari masalah tersebut.
- Model SWE-Llama yang telah difine-tuning juga hanya menyelesaikan masalah paling sederhana dalam dataset.
Kemajuan pada SWE-bench dianggap sebagai langkah menuju pembuatan model bahasa yang lebih praktis, cerdas, dan otonom dalam skenario dunia nyata.