OpenAI는 실제 세계의 소프트웨어 문제를 해결하는 AI 모델의 능력을 더 신뢰성 있게 평가하기 위해 설계된 SWE-bench 벤치마크의 인간 검증된 하위셋인 SWE-bench Verified를 출시했습니다. 이 새로운 버전은 이전에 모델의 능력을 과소평가하게 했던 결점을 해소함으로써 기존 SWE-bench 및 SWE-bench Lite 테스트 세트들을 대체합니다.
이번 출시에는 잘 정의된 문제 설명과 적절한 범위의 유닛 테스트를 보장하기 위해 전문 개발자들이 검증한 500개의 샘플이 포함되어 있습니다. 또한 모든 1,699개 샘플링된 테스트 항목에 대한 주석을 제공하여 '쉬움'(196개 작업) 및 '어려움'(45개 작업) 하위셋으로 난이도별 분할을 가능하게 합니다. 추가로 설정의 신뢰성을 개선하기 위해 컨테이너화된 Docker 환경을 사용하는 새로운 평가 허브도 함께 출시되었습니다.
SWE-bench Verified에서 GPT-4o는 샘플의 33.2%를 해결하며, 최고 성능의 오픈소스 기반인 Agentless는 이전 점수보다 두 배 증가한 16%를 기록했습니다.