Benchmark · agentic

SWE-bench Verified

63 hasil 41 model

Menguji apakah sebuah agen AI mampu menyelesaikan issue GitHub nyata dari awal hingga akhir. Himpunan "Verified" berisi 500 tugas yang divalidasi manusia dari repositori Python open source populer.

Selengkapnya
Contoh
Diberi laporan bug dan repositorinya, model harus menghasilkan patch kode — misalnya memperbaiki fungsi parsing tanggal yang gagal agar suite tes proyek lolos.
Penilaian
% issue yang berhasil diselesaikan — biasanya dilaporkan sebagai pass@1 (satu percobaan). Makin tinggi makin baik.
Verifikasi
Sepenuhnya otomatis: patch yang dihasilkan diterapkan dan unit test tersembunyi asli milik proyek dijalankan di dalam sandbox. Sebuah tugas hanya dihitung jika setiap tes target lolos dan tidak ada yang mengalami regresi.
Mengapa penting
Benchmark agen coding dunia nyata terdepan sekaligus angka utama di setiap rilis frontier; kemajuan di sini menunjukkan seberapa dekat agen dengan rekayasa perangkat lunak otonom.
Contoh penyelesaian
Tugas
Repositori django/django pada base commit yang tetap. Laporan bug: django.utils.text.slugify("___This-is-a-Test___", allow_unicode=True) mengembalikan '___this-is-a-test___', padahal garis bawah dan tanda hubung di awal/akhir seharusnya dipangkas sehingga hasilnya menjadi 'this-is-a-test'. Model hanya diberi teks issue beserta repositorinya dan harus mengeluarkan patch dalam format unified diff.
Solusi
--- a/django/utils/text.py
+++ b/django/utils/text.py
@@ def slugify(value, allow_unicode=False):
     value = re.sub(r"[^\w\s-]", "", value.lower())
-    return re.sub(r"[-\s]+", "-", value)
+    return re.sub(r"[-\s]+", "-", value).strip("-_")
Penjelasan
slugify menyatukan pemisah di dalam string tetapi tidak pernah memangkas -/_ di sekelilingnya, sehingga menambahkan .strip("-_") pada re.sub terakhir menghapusnya; patch ini minimal dan mempertahankan seluruh perilaku lainnya. SWE-bench Verified menerapkan patch ke repositori pada base commit dan menilai dengan menjalankan suite tersembunyi — dinyatakan lolos hanya jika setiap tes FAIL_TO_PASS berubah menjadi lolos sementara semua tes PASS_TO_PASS tetap hijau.
0 25 50 75 100 2024-08-13 2025-08-11 2026-08-10 Agentless · 32 · 2024-08-13 GPT‑4o · 33.2 · 2024-08-13 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-30 Claude 3.5 Sonnet · 49 · 2025-01-06 Claude 3.5 Haiku · 40.6 · 2024-10-22 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2026-03-25 GPT-4.5 · 38 · 2025-03-05 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-26 GPT-4.1 · 54.6 · 2025-04-14 GPT‑4.1 · 54.6 · 2025-04-14 o4-mini · 68.1 · 2025-04-17 Devstral · 46.8 · 2025-05-21 Claude Opus 4 · 72.5 · 2025-05-22 Claude Opus 4 · 72.5 · 2025-05-23 Claude Sonnet 4 · 72.7 · 2025-05-23 Deepseek-R1-0528 · 57.6 · 2025-05-30 Devstral Medium · 61.6 · 2025-07-10 Devstral Small 1.1 · 53.6 · 2025-07-10 Kimi K2-Instruct · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-28 Kimi K2 · 65.8 · 2025-07-28 GLM-4.5 · 64.2 · 2025-08-06 GPT‑5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 Claude Sonnet 4.5 · 77.2 · 2025-09-29 Claude Sonnet 4.5 · 77.2 · 2025-09-30 Kimi K2 Thinking · 71.3 · 2025-11-07 Kimi K2 Thinking · 71.3 · 2025-11-19 GPT-5.1-Codex-Max · 77.9 · 2025-11-19 Devstral 2 · 72.2 · 2025-12-09 Devstral 2 · 72.2 · 2026-07-17 Devstral Small 2 · 68 · 2025-12-09 Devstral Small 2 · 68 · 2026-07-17 GPT-5.2 Thinking · 80 · 2025-12-11 GPT-5.2 Thinking · 80 · 2025-12-11 Qwen3.6-27B · 77.2 · 2026-01-28 Qwen3.6-27B · 77.2 · 2026-04-25 Qwen3.6-27B · 77.2 · 2026-08-10 Claude Opus 4.6 · 80.8 · 2026-02-01 Claude Opus 4.6 · 80.8 · 2026-02-05 MiniMax M2.5 · 80.2 · 2026-02-01 Claude Sonnet 4.6 · 79.6 · 2026-02-17 V4-Pro-Max · 80.6 · 2026-04-24 LLM-as-a-Verifier · 78.2 · 2026-07-07 Qwen3.5-35B-A3B · 6 · 2026-07-14 Qwen3-30B-A3B · 6 · 2026-07-14 DeepSeek V4 Pro · 80.6 · 2026-07-19 Claude Opus 5 · 96 · 2026-07-24 Inkling-Small · 80.2 · 2026-08-03 Orchard-SWE · 69.7 · 2026-08-03 Claude 3.7 Sonnet · 62.3 · 2025-02-24 OpenAI o3 · 71.7 · 2025-04-16
Agentless GPT‑4o Claude 3.5 Sonnet Claude 3.5 Haiku o3 GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 o4-mini Devstral Claude Opus 4 Claude Sonnet 4 Deepseek-R1-0528 Devstral Medium Devstral Small 1.1 Kimi K2-Instruct Kimi K2 GLM-4.5 GPT‑5 GPT-5 Claude Sonnet 4.5 Kimi K2 Thinking GPT-5.1-Codex-Max Devstral 2 Devstral Small 2 GPT-5.2 Thinking Qwen3.6-27B Claude Opus 4.6 MiniMax M2.5 Claude Sonnet 4.6 V4-Pro-Max LLM-as-a-Verifier Qwen3.5-35B-A3B Qwen3-30B-A3B DeepSeek V4 Pro Claude Opus 5 Inkling-Small Orchard-SWE Claude 3.7 Sonnet OpenAI o3
Linimasa
Tanggal Model Skor Sumber
2026-08-10 Qwen3.6-27B 77.2% Meta merilis Muse Glimmer, model agen berbobot terbuka 30B yang berjalan pada satu GPU konsumen
2026-08-03 Orchard-SWE 69.7% Microsoft Research merilis kerangka kerja Orchard untuk AI agenik yang skalabel
2026-08-03 Inkling-Small 80.2% Thinking Machines Lab merilis Inkling-Small, model MoE multimodal dengan bobot terbuka 276B
2026-07-24 Claude Opus 5 96.0% Anthropic merilis Claude Opus 5 dengan pemikiran bawaan dan peningkatan coding agentic
2026-07-19 DeepSeek V4 Pro 80.6% Kimi K3, DeepSeek V4 Pro, dan GLM-5.2 dibandingkan pada benchmark, lisensi, dan biaya penyajian
2026-07-17 Devstral Small 2 68.0% Mistral Vibe for Code memimpin empat agen pemrograman dalam tugas scaffold-ke-PR
2026-07-17 Devstral 2 72.2% Mistral Vibe for Code memimpin empat agen pemrograman dalam tugas scaffold-ke-PR
2026-07-14 Qwen3.5-35B-A3B 6.0% UMoE menata ulang kumpulan ahli MoE untuk penyetelan halus spesifik domain yang lebih baik
2026-07-14 Qwen3-30B-A3B 6.0% UMoE menata ulang kumpulan ahli MoE untuk penyetelan halus spesifik domain yang lebih baik
2026-07-07 LLM-as-a-Verifier 78.2% LLM-as-a-Verifier memperkenalkan kerangka verifikasi serbaguna dengan skor kontinu
2026-04-25 Qwen3.6-27B 77.2% Alibaba merilis Qwen3.6-27B, mengungguli pendahulu yang lebih besar dalam benchmark pemrograman
2026-04-24 V4-Pro-Max 80.6% DeepSeek merilis V4 dengan arsitektur konteks panjang yang efisien untuk agen
2026-03-25 o3 71.7% OpenAI mengumumkan pensiunnya o3 dari ChatGPT dan membagikan skor benchmark
2026-02-17 Claude Sonnet 4.6 79.6% Anthropic merilis Claude Sonnet 4.6 dengan peningkatan coding, penggunaan komputer, dan konteks 1M token
2026-02-05 Claude Opus 4.6 80.8% Anthropic merilis Claude Opus 4.6 dengan jendela konteks 1M dan peningkatan agentic
2026-02-01 Claude Opus 4.6 80.8% Benchmark yang telah didekontaminasi mengungkap kesenjangan 12 poin antara model pemrograman AI teratas
2026-02-01 MiniMax M2.5 80.2% Benchmark yang telah didekontaminasi mengungkap kesenjangan 12 poin antara model pemrograman AI teratas
2026-01-28 Qwen3.6-27B 77.2% Qwen 3.6-27B dan DeepSeek V4 Flash memimpin benchmark pemrograman lokal
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI memperkenalkan GPT-5.2 dengan kemampuan kerja pengetahuan profesional terkini
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI merilis GPT-5.2, mengungguli Gemini 3 dalam benchmark pemrograman dan penalaran
2025-12-09 Devstral 2 72.2% Mistral merilis model coding Devstral 2 dan Mistral Vibe CLI
2025-12-09 Devstral Small 2 68.0% Mistral merilis model coding Devstral 2 dan Mistral Vibe CLI
2025-11-19 GPT-5.1-Codex-Max 77.9% OpenAI menjadikan GPT-5.1-Codex-Max sebagai default di Codex CLI
2025-11-19 Kimi K2 Thinking 71.3% Moonshot AI merilis Kimi K2 Thinking dengan penggunaan alat agentic
2025-11-07 Kimi K2 Thinking 71.3% Moonshot AI merilis Kimi K2 Thinking, model penalaran open-source 1T parameter
2025-09-30 Claude Sonnet 4.5 77.2% Anthropic merilis Claude Sonnet 4.5 dengan kemampuan coding dan agen yang ditingkatkan
2025-09-29 Claude Sonnet 4.5 77.2% Anthropic
2025-08-07 GPT‑5 74.9% OpenAI merilis API GPT-5 dengan peningkatan coding dan agentic
2025-08-07 GPT-5 74.9% OpenAI meluncurkan GPT-5 dengan penalaran adaptif dan arsitektur terpadu
2025-08-07 GPT-5 74.9% OpenAI meluncurkan GPT-5 terpadu dengan penataan rute waktu nyata dan akses gratis
2025-08-07 GPT-5 74.9% OpenAI memperkenalkan GPT-5 dengan routing terpadu dan penalaran tingkat ahli
2025-08-07 GPT-5 74.9% OpenAI
2025-08-06 GLM-4.5 64.2% Zhipu AI merilis model GLM-4.5 yang setara dengan Claude dan DeepSeek
2025-07-28 Kimi K2 65.8% Kimi K2: model MoE terbuka dengan 1T parameter dan pengoptimal MuonClip
2025-07-28 Kimi K2 65.8% Moonshot merilis Kimi K2, model MoE agentic terbuka dengan 32B parameter aktif
2025-07-11 Kimi K2-Instruct 65.8% Moonshot AI merilis Kimi-K2-Instruct, model MoE 1T parameter dengan kemampuan agentic
2025-07-11 Kimi K2 65.8% Moonshot AI merilis Kimi K2, model MoE 1T parameter dengan kemampuan agentic
2025-07-10 Devstral Medium 61.6% Mistral AI merilis Devstral Small 1.1 dan Devstral Medium bersama All Hands AI
2025-07-10 Devstral Small 1.1 53.6% Mistral AI merilis Devstral Small 1.1 dan Devstral Medium bersama All Hands AI
2025-05-30 Deepseek-R1-0528 57.6% DeepSeek memperbarui model R1 dengan penalaran dan skor benchmark yang lebih baik
2025-05-23 Claude Opus 4 72.5% Anthropic merilis Claude Opus 4 dan Sonnet 4 dengan penalaran hibrida
2025-05-23 Claude Sonnet 4 72.7% Anthropic merilis Claude Opus 4 dan Sonnet 4 dengan penalaran hibrida
2025-05-22 Claude Opus 4 72.5% Anthropic
2025-05-21 Devstral 46.8% Mistral AI merilis Devstral, LLM agentic untuk rekayasa perangkat lunak
2025-04-17 o4-mini 68.1% OpenAI merilis o4-mini, model penalaran multimodal yang lebih cepat dan murah
2025-04-16 OpenAI o3 71.7% OpenAI
2025-04-14 GPT-4.1 54.6% OpenAI merilis keluarga GPT-4.1 dengan konteks 1M token dan peningkatan pemrograman
2025-04-14 GPT‑4.1 54.6% OpenAI meluncurkan GPT-4.1, GPT-4.1 mini, dan GPT-4.1 nano di API
2025-03-26 Gemini 2.5 Pro 63.8% Google merilis model penalaran Gemini 2.5 Pro eksperimental dengan konteks 1M token
2025-03-25 Gemini 2.5 Pro 63.8% Google memperkenalkan model berpikir Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 63.8% Google memperkenalkan model eksperimental Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 63.8% Google DeepMind
2025-03-05 GPT-4.5 38.0% OpenAI merilis GPT-4.5, model terbesarnya, untuk ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 62.3% Anthropic
2025-01-06 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnet mencapai 49% pada SWE-bench Verified
2024-12-20 o3 71.7% OpenAI merilis model o3 dengan kinerja tinggi dalam penalaran dan pemrograman
2024-12-20 o3 71.7% OpenAI memamerkan model penalaran o3 dengan terobosan ARC AGI dan Frontier Math
2024-10-30 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonet mencapai skor 49% pada SWE-bench Verified dengan perancah agen yang minimal
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic meningkatkan Claude 3.5 Sonnet, merilis Claude 3.5 Haiku dan beta penggunaan komputer
2024-10-22 Claude 3.5 Haiku 40.6% Anthropic meningkatkan Claude 3.5 Sonnet, merilis Claude 3.5 Haiku dan beta penggunaan komputer
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic
2024-08-13 Agentless 32.0% OpenAI merilis SWE-bench Verified dengan subset yang divalidasi manusia
2024-08-13 GPT‑4o 33.2% OpenAI merilis SWE-bench Verified dengan subset yang divalidasi manusia