El artículo presenta SWE-bench, un marco de evaluación diseñado para probar las capacidades de los modelos de lenguaje en tareas de ingeniería de software del mundo real. Consiste en 2.294 problemas extraídos de issues y pull requests reales en 12 repositorios Python populares.
- El benchmark requiere que los modelos editen bases de código para resolver problemas específicos, a menudo implicando coordinación entre múltiples funciones, clases y archivos.
- Los modelos deben interactuar con entornos de ejecución, procesar contextos extremadamente largos y realizar razonamiento complejo más allá de la generación de código tradicional.
- Las evaluaciones muestran que incluso los modelos propietarios más avanzados tienen dificultades significativas; el modelo mejor rendimiento, Claude 2, resolvió solo el 1,96% de los problemas.
- El modelo ajustado SWE-Llama también resolvió solo los problemas más simples dentro del conjunto de datos.
Los avances en SWE-bench se consideran pasos hacia la creación de modelos de lenguaje más prácticos, inteligentes y autónomos en escenarios del mundo real.