OpenAI telah merilis SWE-bench Verified, sebuah subset yang divalidasi manusia dari benchmark SWE-bench yang dirancang untuk mengevaluasi kemampuan model AI dalam menyelesaikan masalah perangkat lunak dunia nyata secara lebih andal. Versi baru ini menggantikan set uji SWE-bench asli dan SWE-bench Lite dengan mengatasi kekurangan yang sebelumnya menyebabkan underestimasi kemampuan model.
Rilis ini mencakup 500 sampel yang diverifikasi oleh pengembang profesional untuk memastikan deskripsi masalah yang terspesifikasi dengan baik dan unit test yang cakupannya sesuai. Ini juga menyediakan anotasi untuk semua 1.699 item uji sampel, memungkinkan pemotongan kesulitan menjadi subset 'mudah' (196 tugas) dan 'sulit' (45 tugas). Selain itu, sebuah harness evaluasi baru menggunakan lingkungan Docker terkontainerisasi dirilis untuk meningkatkan keandalan penyiapan.
Pada SWE-bench Verified, GPT-4o menyelesaikan 33,2% sampel, sementara scaffold open-source terbaik, Agentless, menggandakan skor sebelumnya menjadi 16%.