OpenAI a publié SWE-bench Verified, un sous-ensemble validé par des humains du benchmark SWE-bench conçu pour évaluer de manière plus fiable la capacité des modèles d'IA à résoudre des problèmes logiciels réels. Cette nouvelle version remplace les ensembles de test originaux SWE-bench et SWE-bench Lite en corrigeant les défauts qui conduisaient précédemment à une sous-estimation des capacités des modèles.

La publication comprend 500 échantillons vérifiés par des développeurs professionnels pour garantir des descriptions de problèmes bien spécifiées et des tests unitaires d'une portée appropriée. Elle fournit également des annotations pour les 1 699 éléments testés échantillonnés, permettant un découpage de la difficulté en sous-ensembles « facile » (196 tâches) et « difficile » (45 tâches). De plus, un nouveau cadre d'évaluation utilisant des environnements Docker conteneurisés est publié pour améliorer la fiabilité de l'installation.

Sur SWE-bench Verified, GPT-4o résout 33,2 % des échantillons, tandis que le meilleur squelette open-source, Agentless, double son score précédent à 16 %.