벤치마크 · agentic

SWE-bench Verified

63 결과 41 모델

AI 에이전트가 실제 GitHub issue를 처음부터 끝까지 해결할 수 있는지 평가합니다. "Verified" 세트는 인기 오픈소스 Python 저장소에서 뽑아 사람이 검증한 500개의 과제입니다.

자세히 보기
예시
버그 리포트와 저장소가 주어지면 모델은 코드 patch를 만들어 내야 합니다 — 예를 들어 실패하는 날짜 파싱 함수를 고쳐 프로젝트의 테스트 스위트가 통과하도록 만드는 식입니다.
채점 방식
해결한 issue의 비율 — 보통 pass@1(한 번의 시도)로 보고합니다. 높을수록 좋습니다.
검증 방식
완전 자동입니다: 생성된 patch를 적용하고 프로젝트의 실제 숨겨진 유닛 테스트를 샌드박스에서 실행합니다. 모든 대상 테스트가 통과하고 아무것도 회귀하지 않을 때만 과제가 인정됩니다.
왜 중요한가
실제 환경 코딩 에이전트를 다루는 대표 벤치마크이자 모든 프런티어 릴리스의 간판 수치로, 여기서의 진전은 에이전트가 자율적인 소프트웨어 엔지니어링에 얼마나 가까워졌는지를 보여줍니다.
예제 풀이
문제
고정된 기준 commit 상태의 django/django 저장소. 버그 리포트: django.utils.text.slugify("___This-is-a-Test___", allow_unicode=True)'___this-is-a-test___' 를 반환하지만, 앞뒤의 밑줄과 하이픈은 제거되어 결과가 'this-is-a-test' 가 되어야 합니다. 모델에는 issue 텍스트와 저장소만 주어지며, unified diff 형식의 patch를 출력해야 합니다.
해답
--- a/django/utils/text.py
+++ b/django/utils/text.py
@@ def slugify(value, allow_unicode=False):
     value = re.sub(r"[^\w\s-]", "", value.lower())
-    return re.sub(r"[-\s]+", "-", value)
+    return re.sub(r"[-\s]+", "-", value).strip("-_")
풀이
slugify는 내부 구분자를 하나로 합치지만 주변의 -/_ 는 결코 잘라내지 않으므로, 마지막 re.sub.strip("-_") 를 덧붙이면 그것들이 제거됩니다. patch는 최소한이며 다른 모든 동작은 그대로 보존합니다. SWE-bench Verified는 기준 commit 상태의 저장소에 patch를 적용하고 숨겨진 스위트를 실행해 채점합니다 — 모든 FAIL_TO_PASS 테스트가 통과로 바뀌고 모든 PASS_TO_PASS 테스트가 그대로 통과일 때만 인정됩니다.
0 25 50 75 100 2024-08-13 2025-08-11 2026-08-10 Agentless · 32 · 2024-08-13 GPT‑4o · 33.2 · 2024-08-13 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-30 Claude 3.5 Sonnet · 49 · 2025-01-06 Claude 3.5 Haiku · 40.6 · 2024-10-22 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2026-03-25 GPT-4.5 · 38 · 2025-03-05 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-26 GPT-4.1 · 54.6 · 2025-04-14 GPT‑4.1 · 54.6 · 2025-04-14 o4-mini · 68.1 · 2025-04-17 Devstral · 46.8 · 2025-05-21 Claude Opus 4 · 72.5 · 2025-05-22 Claude Opus 4 · 72.5 · 2025-05-23 Claude Sonnet 4 · 72.7 · 2025-05-23 Deepseek-R1-0528 · 57.6 · 2025-05-30 Devstral Medium · 61.6 · 2025-07-10 Devstral Small 1.1 · 53.6 · 2025-07-10 Kimi K2-Instruct · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-28 Kimi K2 · 65.8 · 2025-07-28 GLM-4.5 · 64.2 · 2025-08-06 GPT‑5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 Claude Sonnet 4.5 · 77.2 · 2025-09-29 Claude Sonnet 4.5 · 77.2 · 2025-09-30 Kimi K2 Thinking · 71.3 · 2025-11-07 Kimi K2 Thinking · 71.3 · 2025-11-19 GPT-5.1-Codex-Max · 77.9 · 2025-11-19 Devstral 2 · 72.2 · 2025-12-09 Devstral 2 · 72.2 · 2026-07-17 Devstral Small 2 · 68 · 2025-12-09 Devstral Small 2 · 68 · 2026-07-17 GPT-5.2 Thinking · 80 · 2025-12-11 GPT-5.2 Thinking · 80 · 2025-12-11 Qwen3.6-27B · 77.2 · 2026-01-28 Qwen3.6-27B · 77.2 · 2026-04-25 Qwen3.6-27B · 77.2 · 2026-08-10 Claude Opus 4.6 · 80.8 · 2026-02-01 Claude Opus 4.6 · 80.8 · 2026-02-05 MiniMax M2.5 · 80.2 · 2026-02-01 Claude Sonnet 4.6 · 79.6 · 2026-02-17 V4-Pro-Max · 80.6 · 2026-04-24 LLM-as-a-Verifier · 78.2 · 2026-07-07 Qwen3.5-35B-A3B · 6 · 2026-07-14 Qwen3-30B-A3B · 6 · 2026-07-14 DeepSeek V4 Pro · 80.6 · 2026-07-19 Claude Opus 5 · 96 · 2026-07-24 Inkling-Small · 80.2 · 2026-08-03 Orchard-SWE · 69.7 · 2026-08-03 Claude 3.7 Sonnet · 62.3 · 2025-02-24 OpenAI o3 · 71.7 · 2025-04-16
Agentless GPT‑4o Claude 3.5 Sonnet Claude 3.5 Haiku o3 GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 o4-mini Devstral Claude Opus 4 Claude Sonnet 4 Deepseek-R1-0528 Devstral Medium Devstral Small 1.1 Kimi K2-Instruct Kimi K2 GLM-4.5 GPT‑5 GPT-5 Claude Sonnet 4.5 Kimi K2 Thinking GPT-5.1-Codex-Max Devstral 2 Devstral Small 2 GPT-5.2 Thinking Qwen3.6-27B Claude Opus 4.6 MiniMax M2.5 Claude Sonnet 4.6 V4-Pro-Max LLM-as-a-Verifier Qwen3.5-35B-A3B Qwen3-30B-A3B DeepSeek V4 Pro Claude Opus 5 Inkling-Small Orchard-SWE Claude 3.7 Sonnet OpenAI o3
타임라인
날짜 모델 점수 출처
2026-08-10 Qwen3.6-27B 77.2% Meta가 단일 소비자용 GPU에서 구동되는 30B 오픈 가중치 에이전트 모델인 Muse Glimmer를 출시
2026-08-03 Orchard-SWE 69.7% Microsoft Research가 확장 가능한 에이전트형 AI를 위한 Orchard 프레임워크 출시
2026-08-03 Inkling-Small 80.2% Thinking Machines Lab이 276B 오픈 가중치 멀티모달 MoE 모델인 Inkling-Small을 출시
2026-07-24 Claude Opus 5 96.0% Anthropic이 기본 사고 기능과 에이전트 코딩 성능 향상을 갖춘 Claude Opus 5 출시
2026-07-19 DeepSeek V4 Pro 80.6% Kimi K3, DeepSeek V4 Pro, GLM-5.2 벤치마크, 라이선스, 서빙 비용 비교
2026-07-17 Devstral Small 2 68.0% 코드를 위한 Mistral Vibe가 스캐폴드부터 PR까지의 작업에서 네 가지 코딩 에이전트를 선도하다
2026-07-17 Devstral 2 72.2% 코드를 위한 Mistral Vibe가 스캐폴드부터 PR까지의 작업에서 네 가지 코딩 에이전트를 선도하다
2026-07-14 Qwen3.5-35B-A3B 6.0% UMoE가 MoE 전문가 풀을 재배치하여 도메인 특화 파인튜닝 개선
2026-07-14 Qwen3-30B-A3B 6.0% UMoE가 MoE 전문가 풀을 재배치하여 도메인 특화 파인튜닝 개선
2026-07-07 LLM-as-a-Verifier 78.2% LLM-as-a-Verifier이 연속 점수 매핑을 위한 범용 검증 프레임워크 도입
2026-04-25 Qwen3.6-27B 77.2% 알리바바, Qwen3.6-27B 출시, 더 큰 후속 모델보다 코딩 벤치마크에서 우위
2026-04-24 V4-Pro-Max 80.6% DeepSeek, 에이전트를 위한 효율적인 장기 컨텍스트 아키텍처를 갖춘 V4 출시
2026-03-25 o3 71.7% OpenAI, ChatGPT에서 o3 은퇴 발표 및 벤치마크 점수 공개
2026-02-17 Claude Sonnet 4.6 79.6% Anthropic, 코딩·컴퓨터 사용·100만 토큰 컨텍스트 개선된 Claude Sonnet 4.6 출시
2026-02-05 Claude Opus 4.6 80.8% Anthropic, 1M 컨텍스트 창과 에이전트 기능 개선을 갖춘 Claude Opus 4.6 출시
2026-02-01 Claude Opus 4.6 80.8% 오염 제거 벤치마크가 드러낸 상위 AI 코딩 모델 간 12포인트 격차
2026-02-01 MiniMax M2.5 80.2% 오염 제거 벤치마크가 드러낸 상위 AI 코딩 모델 간 12포인트 격차
2026-01-28 Qwen3.6-27B 77.2% 로컬 코딩 벤치마크에서 Qwen 3.6-27B와 DeepSeek V4 Flash가 선두
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI, 전문가 지식 작업을 위한 최첨단 능력을 갖춘 GPT-5.2 출시
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI, GPT-5.2 출시, 코딩 및 추론 벤치마크에서 Gemini 3 압도
2025-12-09 Devstral 2 72.2% Mistral, Devstral 2 코딩 모델 및 Mistral Vibe CLI 출시
2025-12-09 Devstral Small 2 68.0% Mistral, Devstral 2 코딩 모델 및 Mistral Vibe CLI 출시
2025-11-19 GPT-5.1-Codex-Max 77.9% OpenAI, Codex CLI의 기본 모델로 GPT-5.1-Codex-Max 채택
2025-11-19 Kimi K2 Thinking 71.3% Moonshot AI, 에이전트 도구 사용 기능을 갖춘 Kimi K2 Thinking 출시
2025-11-07 Kimi K2 Thinking 71.3% Moonshot AI, 오픈소스 1T 파라미터 추론 모델 Kimi K2 Thinking 출시
2025-09-30 Claude Sonnet 4.5 77.2% Anthropic, 코딩 및 에이전트 기능 강화된 Claude Sonnet 4.5 출시
2025-09-29 Claude Sonnet 4.5 77.2% Anthropic
2025-08-07 GPT‑5 74.9% OpenAI, 코딩 및 에이전트 개선된 GPT-5 API 출시
2025-08-07 GPT-5 74.9% OpenAI, 적응형 추론과 통합 아키텍처를 갖춘 GPT-5 출시
2025-08-07 GPT-5 74.9% OpenAI, 실시간 라우팅과 무료 접근성을 갖춘 통합 GPT-5 출시
2025-08-07 GPT-5 74.9% OpenAI가 통합 라우팅과 전문가 수준의 추론을 갖춘 GPT-5를 출시하다
2025-08-07 GPT-5 74.9% OpenAI
2025-08-06 GLM-4.5 64.2% 지푸 AI가 Claude와 DeepSeek에 맞먹는 GLM-4.5 모델 출시
2025-07-28 Kimi K2 65.8% Kimi K2: 1조 파라미터와 MuonClip 옵티마이저를 갖춘 오픈 MoE 모델
2025-07-28 Kimi K2 65.8% Moonshot, 32B 활성화 파라미터를 가진 오픈 에이전트 MoE 모델 Kimi K2 출시
2025-07-11 Kimi K2-Instruct 65.8% Moonshot AI, 에이전트 기능 탑재 1T 파라미터 MoE 모델 Kimi-K2-Instruct 출시
2025-07-11 Kimi K2 65.8% Moonshot AI, 에이전트 기능 탑재 1T 파라미터 MoE 모델 Kimi K2 출시
2025-07-10 Devstral Medium 61.6% Mistral AI, All Hands AI와 함께 Devstral Small 1.1 및 Devstral Medium 출시
2025-07-10 Devstral Small 1.1 53.6% Mistral AI, All Hands AI와 함께 Devstral Small 1.1 및 Devstral Medium 출시
2025-05-30 Deepseek-R1-0528 57.6% DeepSeek, 향상된 추론 및 벤치마크 점수로 R1 모델 업데이트
2025-05-23 Claude Opus 4 72.5% Anthropic, 하이브리드 추론 기능을 갖춘 Claude Opus 4와 Sonnet 4 출시
2025-05-23 Claude Sonnet 4 72.7% Anthropic, 하이브리드 추론 기능을 갖춘 Claude Opus 4와 Sonnet 4 출시
2025-05-22 Claude Opus 4 72.5% Anthropic
2025-05-21 Devstral 46.8% Mistral AI가 소프트웨어 엔지니어링을 위한 Devstral 에이전트 LLM 출시
2025-04-17 o4-mini 68.1% OpenAI가 더 빠르고 저렴한 다중 모달 추론 모델인 o4-mini 출시
2025-04-16 OpenAI o3 71.7% OpenAI
2025-04-14 GPT-4.1 54.6% OpenAI, 100만 토큰 컨텍스트 및 코딩 개선 기능을 갖춘 GPT-4.1 패밀리 출시
2025-04-14 GPT‑4.1 54.6% OpenAI, API에 GPT-4.1, GPT-4.1 mini, GPT-4.1 nano 출시
2025-03-26 Gemini 2.5 Pro 63.8% 구글, 100만 토큰 컨텍스트를 지원하는 실험용 Gemini 2.5 Pro 추론 모델 출시
2025-03-25 Gemini 2.5 Pro 63.8% 구글, Gemini 2.5 Pro 사고 모델 출시
2025-03-25 Gemini 2.5 Pro 63.8% 구글, 실험용 모델 Gemini 2.5 Pro 출시
2025-03-25 Gemini 2.5 Pro 63.8% Google DeepMind
2025-03-05 GPT-4.5 38.0% 오픈에이아이, 차트GPT 플러스용 최대 규모 모델 GPT-4.5 출시
2025-02-24 Claude 3.7 Sonnet 62.3% Anthropic
2025-01-06 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnet, SWE-bench Verified에서 49% 달성
2024-12-20 o3 71.7% OpenAI, 추론 및 코딩에서 높은 성능을 갖춘 o3 모델 출시
2024-12-20 o3 71.7% OpenAI, ARC AGI 및 Frontier Math 돌파구와 함께 o3 추론 모델 미리보기
2024-10-30 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnet, 최소 에이전트 구조로 SWE-bench Verified에서 49% 달성
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic, Claude 3.5 Sonnet 업그레이드 및 Claude 3.5 Haiku와 컴퓨터 사용 베타 출시
2024-10-22 Claude 3.5 Haiku 40.6% Anthropic, Claude 3.5 Sonnet 업그레이드 및 Claude 3.5 Haiku와 컴퓨터 사용 베타 출시
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic
2024-08-13 Agentless 32.0% OpenAI, 인간 검증된 하위셋을 포함한 SWE-bench Verified 출시
2024-08-13 GPT‑4o 33.2% OpenAI, 인간 검증된 하위셋을 포함한 SWE-bench Verified 출시