OpenAI ha lanzado SWE-bench Verified, un subconjunto validado por humanos del benchmark SWE-bench diseñado para evaluar de manera más fiable la capacidad de los modelos de IA para resolver problemas de software del mundo real. Esta nueva versión reemplaza los conjuntos de prueba originales de SWE-bench y SWE-bench Lite al abordar defectos que anteriormente llevaban a subestimar las capacidades de los modelos.

El lanzamiento incluye 500 muestras verificadas por desarrolladores profesionales para garantizar descripciones de problemas bien especificadas y pruebas unitarias con un alcance adecuado. También proporciona anotaciones para los 1.699 elementos de prueba muestreados, permitiendo dividir la dificultad en subconjuntos 'fácil' (196 tareas) y 'difícil' (45 tareas). Además, se lanza un nuevo entorno de evaluación que utiliza entornos Docker contenerizados para mejorar la fiabilidad de la configuración.

En SWE-bench Verified, GPT-4o resuelve el 33.2% de las muestras, mientras que el mejor andamio de código abierto, Agentless, duplica su puntuación anterior al alcanzar el 16%.