El artículo presenta SWE-bench, un marco de evaluación diseñado para probar las capacidades de los modelos de lenguaje en tareas de ingeniería de software del mundo real. Consiste en 2.294 problemas extraídos de issues y pull requests reales en 12 repositorios Python populares.

  • El benchmark requiere que los modelos editen bases de código para resolver problemas específicos, a menudo implicando coordinación entre múltiples funciones, clases y archivos.
  • Los modelos deben interactuar con entornos de ejecución, procesar contextos extremadamente largos y realizar razonamiento complejo más allá de la generación de código tradicional.
  • Las evaluaciones muestran que incluso los modelos propietarios más avanzados tienen dificultades significativas; el modelo mejor rendimiento, Claude 2, resolvió solo el 1,96% de los problemas.
  • El modelo ajustado SWE-Llama también resolvió solo los problemas más simples dentro del conjunto de datos.

Los avances en SWE-bench se consideran pasos hacia la creación de modelos de lenguaje más prácticos, inteligentes y autónomos en escenarios del mundo real.