O artigo apresenta o SWE-bench, um framework de avaliação projetado para testar as capacidades de modelos de linguagem em tarefas de engenharia de software do mundo real. Consiste em 2.294 problemas extraídos de issues e pull requests reais em 12 repositórios Python populares.

  • O benchmark exige que os modelos editem bases de código para resolver problemas específicos, muitas vezes envolvendo coordenação entre múltiplas funções, classes e arquivos.
  • Os modelos devem interagir com ambientes de execução, processar contextos extremamente longos e realizar raciocínio complexo além da geração de código tradicional.
  • As avaliações mostram que mesmo os modelos proprietários mais avançados têm dificuldades significativas; o modelo de melhor desempenho, Claude 2, resolveu apenas 1,96% dos problemas.
  • O modelo ajustado SWE-Llama também resolveu apenas os problemas mais simples dentro do conjunto de dados.

Os avanços no SWE-bench são considerados passos para tornar os modelos de linguagem mais práticos, inteligentes e autônomos em cenários do mundo real.