ベンチマーク · agentic

SWE-bench Verified

63 結果 41 モデル

AI エージェントが実際の GitHub issue を最初から最後まで解決できるかを測定します。「Verified」セットは、人気のオープンソース Python リポジトリから選ばれ、人手で検証された 500 件のタスクです。

詳しく見る
バグ報告とリポジトリが与えられ、モデルはコードの patch を生成しなければなりません。たとえば、失敗している日付解析関数を修正し、プロジェクトのテストスイートが通るようにします。
採点方法
解決した issue の割合(%)。通常は pass@1(1 回の試行)で報告されます。高いほど良好です。
検証方法
完全に自動:生成された patch が適用され、プロジェクトの実際の隠しユニットテストがサンドボックスで実行されます。対象のテストがすべて通り、かつ何もリグレッションしなかった場合にのみ、そのタスクは成功と数えられます。
重要な理由
実世界のコーディングエージェントを測る代表的なベンチマークであり、あらゆるフロンティアモデルのリリースで目玉となる数値です。ここでの進捗は、エージェントが自律的なソフトウェア開発にどれだけ近づいているかを示します。
解説付きの例
課題
固定のベースコミット時点のリポジトリ django/django。バグ報告:django.utils.text.slugify("___This-is-a-Test___", allow_unicode=True)'___this-is-a-test___' を返すが、先頭・末尾のアンダースコアとハイフンは取り除かれ、結果が 'this-is-a-test' になるべきである。モデルには issue の本文とリポジトリだけが与えられ、unified diff 形式の patch を出力しなければなりません。
解答
--- a/django/utils/text.py
+++ b/django/utils/text.py
@@ def slugify(value, allow_unicode=False):
     value = re.sub(r"[^\w\s-]", "", value.lower())
-    return re.sub(r"[-\s]+", "-", value)
+    return re.sub(r"[-\s]+", "-", value).strip("-_")
解説
slugify は内部の区切り文字をまとめるものの、周囲の -/_ を決して取り除かないため、最後の re.sub.strip("-_") を付け足すとそれらが除去されます。patch は最小限で、他の挙動はすべて保たれます。SWE-bench Verified はベースコミット時点のリポジトリに patch を適用し、隠しテストスイートを実行して採点します。すべての FAIL_TO_PASS テストが通るようになり、かつすべての PASS_TO_PASS テストが緑のままである場合にのみ合格となります。
0 25 50 75 100 2024-08-13 2025-08-11 2026-08-10 Agentless · 32 · 2024-08-13 GPT‑4o · 33.2 · 2024-08-13 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-30 Claude 3.5 Sonnet · 49 · 2025-01-06 Claude 3.5 Haiku · 40.6 · 2024-10-22 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2026-03-25 GPT-4.5 · 38 · 2025-03-05 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-26 GPT-4.1 · 54.6 · 2025-04-14 GPT‑4.1 · 54.6 · 2025-04-14 o4-mini · 68.1 · 2025-04-17 Devstral · 46.8 · 2025-05-21 Claude Opus 4 · 72.5 · 2025-05-22 Claude Opus 4 · 72.5 · 2025-05-23 Claude Sonnet 4 · 72.7 · 2025-05-23 Deepseek-R1-0528 · 57.6 · 2025-05-30 Devstral Medium · 61.6 · 2025-07-10 Devstral Small 1.1 · 53.6 · 2025-07-10 Kimi K2-Instruct · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-28 Kimi K2 · 65.8 · 2025-07-28 GLM-4.5 · 64.2 · 2025-08-06 GPT‑5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 Claude Sonnet 4.5 · 77.2 · 2025-09-29 Claude Sonnet 4.5 · 77.2 · 2025-09-30 Kimi K2 Thinking · 71.3 · 2025-11-07 Kimi K2 Thinking · 71.3 · 2025-11-19 GPT-5.1-Codex-Max · 77.9 · 2025-11-19 Devstral 2 · 72.2 · 2025-12-09 Devstral 2 · 72.2 · 2026-07-17 Devstral Small 2 · 68 · 2025-12-09 Devstral Small 2 · 68 · 2026-07-17 GPT-5.2 Thinking · 80 · 2025-12-11 GPT-5.2 Thinking · 80 · 2025-12-11 Qwen3.6-27B · 77.2 · 2026-01-28 Qwen3.6-27B · 77.2 · 2026-04-25 Qwen3.6-27B · 77.2 · 2026-08-10 Claude Opus 4.6 · 80.8 · 2026-02-01 Claude Opus 4.6 · 80.8 · 2026-02-05 MiniMax M2.5 · 80.2 · 2026-02-01 Claude Sonnet 4.6 · 79.6 · 2026-02-17 V4-Pro-Max · 80.6 · 2026-04-24 LLM-as-a-Verifier · 78.2 · 2026-07-07 Qwen3.5-35B-A3B · 6 · 2026-07-14 Qwen3-30B-A3B · 6 · 2026-07-14 DeepSeek V4 Pro · 80.6 · 2026-07-19 Claude Opus 5 · 96 · 2026-07-24 Inkling-Small · 80.2 · 2026-08-03 Orchard-SWE · 69.7 · 2026-08-03 Claude 3.7 Sonnet · 62.3 · 2025-02-24 OpenAI o3 · 71.7 · 2025-04-16
Agentless GPT‑4o Claude 3.5 Sonnet Claude 3.5 Haiku o3 GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 o4-mini Devstral Claude Opus 4 Claude Sonnet 4 Deepseek-R1-0528 Devstral Medium Devstral Small 1.1 Kimi K2-Instruct Kimi K2 GLM-4.5 GPT‑5 GPT-5 Claude Sonnet 4.5 Kimi K2 Thinking GPT-5.1-Codex-Max Devstral 2 Devstral Small 2 GPT-5.2 Thinking Qwen3.6-27B Claude Opus 4.6 MiniMax M2.5 Claude Sonnet 4.6 V4-Pro-Max LLM-as-a-Verifier Qwen3.5-35B-A3B Qwen3-30B-A3B DeepSeek V4 Pro Claude Opus 5 Inkling-Small Orchard-SWE Claude 3.7 Sonnet OpenAI o3
タイムライン
日付 モデル スコア ソース
2026-08-10 Qwen3.6-27B 77.2% Metaが30Bのオープンウェイトエージェントモデル「Muse Glimmer」を1枚のコンシューマーGPUで動作可能として公開
2026-08-03 Orchard-SWE 69.7% Microsoft Research、スケーラブルなエージェント型AI向けのOrchardフレームワークをリリース
2026-08-03 Inkling-Small 80.2% Thinking Machines Labが276Bのオープンウェイト多モーダルMoEモデルInkling-Smallをリリース
2026-07-24 Claude Opus 5 96.0% Anthropicがデフォルトの思考機能とエージェント型コーディングの向上を備えたClaude Opus 5をリリース
2026-07-19 DeepSeek V4 Pro 80.6% ベンチマーク、ライセンス、推論コストで比較されるKimi K3、DeepSeek V4 Pro、GLM-5.2
2026-07-17 Devstral Small 2 68.0% コード用Mistral VibeがスキャフォールドからPRまでのタスクで4つのコーディングエージェントをリード
2026-07-17 Devstral 2 72.2% コード用Mistral VibeがスキャフォールドからPRまでのタスクで4つのコーディングエージェントをリード
2026-07-14 Qwen3.5-35B-A3B 6.0% UMoEがMoEのエキスパートプールを再配置し、ドメイン固有のファインチューニングを改善
2026-07-14 Qwen3-30B-A3B 6.0% UMoEがMoEのエキスパートプールを再配置し、ドメイン固有のファインチューニングを改善
2026-07-07 LLM-as-a-Verifier 78.2% LLM-as-a-Verifierが継続的スコアリングによる汎用検証フレームワークを導入
2026-04-25 Qwen3.6-27B 77.2% アリババ、Qwen3.6-27Bをリリース、コーディングベンチマークでより大きな後継モデルを上回る
2026-04-24 V4-Pro-Max 80.6% DeepSeek、エージェント向けに効率的な長期コンテキストアーキテクチャを搭載したV4をリリース
2026-03-25 o3 71.7% OpenAI、ChatGPTからo3の退役を発表しベンチマークスコアを公開
2026-02-17 Claude Sonnet 4.6 79.6% Anthropicがコーディング、コンピュータ操作、100万トークンコンテキストを改善したClaude Sonnet 4.6をリリース
2026-02-05 Claude Opus 4.6 80.8% Anthropicが1Mコンテキストウィンドウとエージェント機能の改善を備えたClaude Opus 4.6をリリース
2026-02-01 Claude Opus 4.6 80.8% デコンタミネーション済みベンチマークが示すトップAIコーディングモデル間の12ポイントの格差
2026-02-01 MiniMax M2.5 80.2% デコンタミネーション済みベンチマークが示すトップAIコーディングモデル間の12ポイントの格差
2026-01-28 Qwen3.6-27B 77.2% Qwen 3.6-27BとDeepSeek V4 Flashがローカルコーディングベンチマークで首位
2025-12-11 GPT-5.2 Thinking 80.0% OpenAIがGPT-5.2を発表、プロフェッショナルな知識作業の最先端能力を搭載
2025-12-11 GPT-5.2 Thinking 80.0% OpenAIがGPT-5.2をリリース、コーディングおよび推論ベンチマークでGemini 3を上回る
2025-12-09 Devstral 2 72.2% MistralがDevstral 2コーディングモデルとMistral Vibe CLIをリリース
2025-12-09 Devstral Small 2 68.0% MistralがDevstral 2コーディングモデルとMistral Vibe CLIをリリース
2025-11-19 GPT-5.1-Codex-Max 77.9% OpenAI、Codex CLIのデフォルトにGPT-5.1-Codex-Maxを採用
2025-11-19 Kimi K2 Thinking 71.3% Moonshot AIがエージェント型ツール利用を備えたKimi K2 Thinkingをリリース
2025-11-07 Kimi K2 Thinking 71.3% Moonshot AIがKimi K2 Thinkingをリリース、オープンソースの1Tパラメータ推論モデル
2025-09-30 Claude Sonnet 4.5 77.2% AnthropicがClaude Sonnet 4.5をリリース、コーディングとエージェント機能が強化
2025-09-29 Claude Sonnet 4.5 77.2% Anthropic
2025-08-07 GPT‑5 74.9% OpenAIがコーディングおよびエージェント機能の改善されたGPT-5 APIをリリース
2025-08-07 GPT-5 74.9% OpenAIが適応的推論と統一アーキテクチャを搭載したGPT-5をリリース
2025-08-07 GPT-5 74.9% OpenAIがリアルタイムルーティングと無料アクセスを備えた統合GPT-5を発表
2025-08-07 GPT-5 74.9% OpenAIが統一ルーティングと専門レベルの推論を備えたGPT-5を発表
2025-08-07 GPT-5 74.9% OpenAI
2025-08-06 GLM-4.5 64.2% 智譜AIがClaudeやDeepSeekに匹敵するGLM-4.5モデルをリリース
2025-07-28 Kimi K2 65.8% Kimi K2: 1兆パラメータのオープンなMoEモデルとMuonClipオプティマイザ
2025-07-28 Kimi K2 65.8% Moonshotが32Bの活性化パラメータを持つオープンなエージェント型MoEモデル「Kimi K2」をリリース
2025-07-11 Kimi K2-Instruct 65.8% Moonshot AI、エージェント機能を持つ1TパラメータのMoEモデル「Kimi-K2-Instruct」をリリース
2025-07-11 Kimi K2 65.8% Moonshot AI、エージェント機能を持つ1TパラメータのMoEモデル「Kimi K2」をリリース
2025-07-10 Devstral Medium 61.6% Mistral AI、All Hands AIと共同でDevstral Small 1.1およびDevstral Mediumをリリース
2025-07-10 Devstral Small 1.1 53.6% Mistral AI、All Hands AIと共同でDevstral Small 1.1およびDevstral Mediumをリリース
2025-05-30 Deepseek-R1-0528 57.6% DeepSeekがR1モデルを更新し、推論能力とベンチマークスコアを向上
2025-05-23 Claude Opus 4 72.5% Anthropicがハイブリッド推論機能を備えたClaude Opus 4およびSonnet 4をリリース
2025-05-23 Claude Sonnet 4 72.7% Anthropicがハイブリッド推論機能を備えたClaude Opus 4およびSonnet 4をリリース
2025-05-22 Claude Opus 4 72.5% Anthropic
2025-05-21 Devstral 46.8% Mistral AI、ソフトウェアエンジニアリング向けエージェント型LLM「Devstral」をリリース
2025-04-17 o4-mini 68.1% OpenAIが高速で低コストなマルチモーダル推論モデルo4-miniをリリース
2025-04-16 OpenAI o3 71.7% OpenAI
2025-04-14 GPT-4.1 54.6% OpenAIが100万トークンのコンテキストとコーディング改善を備えたGPT-4.1ファミリーをリリース
2025-04-14 GPT‑4.1 54.6% OpenAIがAPIでGPT-4.1、GPT-4.1 mini、GPT-4.1 nanoをリリース
2025-03-26 Gemini 2.5 Pro 63.8% Googleが100万トークンコンテキストを備えた実験的なGemini 2.5 Pro推論モデルをリリース
2025-03-25 Gemini 2.5 Pro 63.8% GoogleがGemini 2.5 Pro思考モデルを発表
2025-03-25 Gemini 2.5 Pro 63.8% Googleが実験的モデルGemini 2.5 Proを発表
2025-03-25 Gemini 2.5 Pro 63.8% Google DeepMind
2025-03-05 GPT-4.5 38.0% OpenAI、ChatGPT Plus向けに最大規模モデルGPT-4.5をリリース
2025-02-24 Claude 3.7 Sonnet 62.3% Anthropic
2025-01-06 Claude 3.5 Sonnet 49.0% Claude 3.5 SonnetがSWE-bench Verifiedで49%を達成
2024-12-20 o3 71.7% OpenAI、推論とコーディングで高性能なモデルo3をリリース
2024-12-20 o3 71.7% OpenAI、ARC AGIおよびFrontier Mathでの突破を示すo3推論モデルをプレビュー
2024-10-30 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnetが最小限のエージェント支援でSWE-bench Verifiedで49%を達成
2024-10-22 Claude 3.5 Sonnet 49.0% AnthropicがClaude 3.5 Sonnetをアップグレード、Claude 3.5 Haikuとコンピュータ操作ベータ版をリリース
2024-10-22 Claude 3.5 Haiku 40.6% AnthropicがClaude 3.5 Sonnetをアップグレード、Claude 3.5 Haikuとコンピュータ操作ベータ版をリリース
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic
2024-08-13 Agentless 32.0% OpenAIがSWE-bench Verifiedを公開、人間検証済みサブセット付き
2024-08-13 GPT‑4o 33.2% OpenAIがSWE-bench Verifiedを公開、人間検証済みサブセット付き