논문에서는 실제 소프트웨어 엔지니어링 작업에서 언어 모델의 능력을 테스트하도록 설계된 평가 프레임워크인 SWE-bench를 소개합니다. 이는 12개의 인기 있는 Python 저장소에서 실제 GitHub 이슈와 풀 리퀘스트에서 추출한 2,294개의 문제로 구성됩니다.

  • 벤치마크는 모델이 특정 문제를 해결하기 위해 코드베이스를 편집하도록 요구하며, 종종 여러 함수, 클래스 및 파일에 걸친 조정이 필요합니다.
  • 모델은 실행 환경과 상호 작용하고, 매우 긴 컨텍스트를 처리하며, 전통적인 코드 생성을 넘어선 복잡한 추론을 수행해야 합니다.
  • 평가 결과, 최신 독점 모델조차도 상당히 어려움을 겪고 있으며, 가장 잘 수행된 모델인 Claude 2는 문제의 1.96%만 해결했습니다.
  • 파인튜닝된 모델 SWE-Llama도 데이터 세트 내에서 가장 간단한 문제만 해결했습니다.

SWE-bench에서의 진보는 실제 시나리오에서 언어 모델을 더 실용적이고, 지능적이며, 자율적으로 만들기 위한 단계로 간주됩니다.