벤치마크 · agentic

SWE-bench Multilingual

7 결과 5 모델

SWE-bench Multilingual은 AI 코딩 에이전트가 여러 프로그래밍 언어의 코드 저장소를 편집하여 실제 GitHub issue를 해결할 수 있는지를 측정합니다. 점수는 % Resolved로, 300개 과제 중 수정이 프로젝트 자체 테스트를 통과하는 비율입니다.

자세히 보기
예시
과제 유형: 에이전트에게 실제 open-source 저장소(예: Go, Java, Ruby 프로젝트)의 버그 리포트와 수정 이전 commit 시점의 코드베이스가 주어지며, 하나 이상의 파일을 편집해 설명된 문제를 없애는 patch를 만들어야 합니다 — 참조 해답은 제공되지 않습니다.
채점 방식
지표는 % Resolved입니다. 300개 인스턴스 각각을 통과/실패로 채점하고, 점수는 통과한 비율입니다. 에이전트의 patch를 적용한 뒤 버그를 겨냥한 Fail-to-Pass 테스트가 모두 통과하고 모든 Pass-to-Pass 테스트(기존 동작)가 여전히 통과할 때에만 그 인스턴스가 통과로 인정됩니다.
검증 방식
patch는 격리된 container에서 저장소의 테스트 스위트를 실행하여 검증됩니다. 지정된 Fail-to-Pass 테스트가 이제 통과해야 하고 모든 Pass-to-Pass 테스트가 계속 통과해야 합니다. 실패, 오류, 적용되지 않는 patch가 하나라도 있으면 해당 인스턴스는 미해결로 표시되며, 부분 점수는 없습니다.
왜 중요한가
Python을 넘어 9개 언어와 42개의 실제 저장소에서 코딩 능력을 검증하며, 모델이 Go, Rust, PHP 같은 언어에서는 Python보다 훨씬 적은 issue만 해결한다는 사실을 드러냅니다 — 언어를 넘나드는 소프트웨어 공학 일반화 능력에 대한 더 정직한 시험입니다.
예제 풀이
문제
예시적 대표 인스턴스. 저장소: 수정 이전 commit 상태의 Go 문자열 유틸리티 라이브러리. Issue: Reverse()가 멀티바이트 UTF-8 문자가 포함된 문자열에서 panic을 일으키거나 깨진 텍스트를 반환합니다. Fail-to-Pass 테스트 TestReverseUnicodeReverse("héllo") == "olléh"를 기대합니다. 에이전트는 issue 본문과 저장소만 받으며 참조 patch는 없습니다.
해답
func Reverse(s string) string {
	r := []rune(s)
	for i, j := 0, len(r)-1; i < j; i, j = i+1, j-1 {
		r[i], r[j] = r[j], r[i]
	}
	return string(r)
}
풀이
원래 코드는 문자열을 바이트 단위로 뒤집어 멀티바이트 UTF-8 rune을 쪼개고 é 같은 문자를 손상시켰습니다. []rune 슬라이스로 변환해 양 끝을 교환하면 Unicode 코드 포인트 단위로 뒤집히므로 Reverse("héllo")"olléh"가 됩니다. 채점: TestReverseUnicode(Fail-to-Pass)가 이제 통과하고 container 내 모든 Pass-to-Pass 테스트가 계속 통과할 때에만 인정됩니다.
0 21 42 63 84 2025-07-11 2026-01-15 2026-07-22 Kimi K2 · 47.3 · 2025-07-11 Kimi K2 · 47.3 · 2025-07-28 Kimi K2 · 47.3 · 2025-07-28 Kimi K2-Instruct · 47.3 · 2025-07-11 Kimi K2 Thinking · 61.1 · 2025-11-07 Composer 2 · 73.7 · 2026-03-27 Laguna S 2.1 · 78.5 · 2026-07-22
Kimi K2 Kimi K2-Instruct Kimi K2 Thinking Composer 2 Laguna S 2.1
타임라인
날짜 모델 점수 출처
2026-07-22 Laguna S 2.1 78.5% Poolside가 오픈 가중치 에이전트형 코딩 모델 Laguna S 2.1 출시
2026-03-27 Composer 2 73.7% Cursor, 에이전트 코딩 모델 학습에 대한 Composer 2 기술 보고서 발표
2025-11-07 Kimi K2 Thinking 61.1% Moonshot AI, 오픈소스 1T 파라미터 추론 모델 Kimi K2 Thinking 출시
2025-07-28 Kimi K2 47.3% Moonshot, 32B 활성화 파라미터를 가진 오픈 에이전트 MoE 모델 Kimi K2 출시
2025-07-28 Kimi K2 47.3% Kimi K2: 1조 파라미터와 MuonClip 옵티마이저를 갖춘 오픈 MoE 모델
2025-07-11 Kimi K2 47.3% Moonshot AI, 에이전트 기능 탑재 1T 파라미터 MoE 모델 Kimi K2 출시
2025-07-11 Kimi K2-Instruct 47.3% Moonshot AI, 에이전트 기능 탑재 1T 파라미터 MoE 모델 Kimi-K2-Instruct 출시