벤치마크 · agentic
SWE-bench Multilingual
SWE-bench Multilingual은 AI 코딩 에이전트가 여러 프로그래밍 언어의 코드 저장소를 편집하여 실제 GitHub issue를 해결할 수 있는지를 측정합니다. 점수는 % Resolved로, 300개 과제 중 수정이 프로젝트 자체 테스트를 통과하는 비율입니다.
자세히 보기
- 예시
- 과제 유형: 에이전트에게 실제 open-source 저장소(예: Go, Java, Ruby 프로젝트)의 버그 리포트와 수정 이전 commit 시점의 코드베이스가 주어지며, 하나 이상의 파일을 편집해 설명된 문제를 없애는 patch를 만들어야 합니다 — 참조 해답은 제공되지 않습니다.
- 채점 방식
- 지표는 % Resolved입니다. 300개 인스턴스 각각을 통과/실패로 채점하고, 점수는 통과한 비율입니다. 에이전트의 patch를 적용한 뒤 버그를 겨냥한 Fail-to-Pass 테스트가 모두 통과하고 모든 Pass-to-Pass 테스트(기존 동작)가 여전히 통과할 때에만 그 인스턴스가 통과로 인정됩니다.
- 검증 방식
- patch는 격리된 container에서 저장소의 테스트 스위트를 실행하여 검증됩니다. 지정된 Fail-to-Pass 테스트가 이제 통과해야 하고 모든 Pass-to-Pass 테스트가 계속 통과해야 합니다. 실패, 오류, 적용되지 않는 patch가 하나라도 있으면 해당 인스턴스는 미해결로 표시되며, 부분 점수는 없습니다.
- 왜 중요한가
- Python을 넘어 9개 언어와 42개의 실제 저장소에서 코딩 능력을 검증하며, 모델이 Go, Rust, PHP 같은 언어에서는 Python보다 훨씬 적은 issue만 해결한다는 사실을 드러냅니다 — 언어를 넘나드는 소프트웨어 공학 일반화 능력에 대한 더 정직한 시험입니다.
예제 풀이
문제
예시적 대표 인스턴스. 저장소: 수정 이전 commit 상태의 Go 문자열 유틸리티 라이브러리. Issue:
Reverse()가 멀티바이트 UTF-8 문자가 포함된 문자열에서 panic을 일으키거나 깨진 텍스트를 반환합니다. Fail-to-Pass 테스트 TestReverseUnicode는 Reverse("héllo") == "olléh"를 기대합니다. 에이전트는 issue 본문과 저장소만 받으며 참조 patch는 없습니다.해답
func Reverse(s string) string {
r := []rune(s)
for i, j := 0, len(r)-1; i < j; i, j = i+1, j-1 {
r[i], r[j] = r[j], r[i]
}
return string(r)
}
풀이
원래 코드는 문자열을 바이트 단위로 뒤집어 멀티바이트 UTF-8 rune을 쪼개고
é 같은 문자를 손상시켰습니다. []rune 슬라이스로 변환해 양 끝을 교환하면 Unicode 코드 포인트 단위로 뒤집히므로 Reverse("héllo")는 "olléh"가 됩니다. 채점: TestReverseUnicode(Fail-to-Pass)가 이제 통과하고 container 내 모든 Pass-to-Pass 테스트가 계속 통과할 때에만 인정됩니다.| 날짜 | 모델 | 점수 | 출처 |
|---|---|---|---|
| 2026-07-22 | Laguna S 2.1 | 78.5% | Poolside가 오픈 가중치 에이전트형 코딩 모델 Laguna S 2.1 출시 |
| 2026-03-27 | Composer 2 | 73.7% | Cursor, 에이전트 코딩 모델 학습에 대한 Composer 2 기술 보고서 발표 |
| 2025-11-07 | Kimi K2 Thinking | 61.1% | Moonshot AI, 오픈소스 1T 파라미터 추론 모델 Kimi K2 Thinking 출시 |
| 2025-07-28 | Kimi K2 | 47.3% | Moonshot, 32B 활성화 파라미터를 가진 오픈 에이전트 MoE 모델 Kimi K2 출시 |
| 2025-07-28 | Kimi K2 | 47.3% | Kimi K2: 1조 파라미터와 MuonClip 옵티마이저를 갖춘 오픈 MoE 모델 |
| 2025-07-11 | Kimi K2 | 47.3% | Moonshot AI, 에이전트 기능 탑재 1T 파라미터 MoE 모델 Kimi K2 출시 |
| 2025-07-11 | Kimi K2-Instruct | 47.3% | Moonshot AI, 에이전트 기능 탑재 1T 파라미터 MoE 모델 Kimi-K2-Instruct 출시 |