Benchmark · agentic

SWE-bench Pro

18 hasil 12 model

Versi SWE-bench yang lebih sulit dan tahan terhadap kontaminasi dari Scale AI. Benchmark ini menarik ~1,865 issue GitHub nyata dari repositori enterprise, startup, dan open-source yang disisihkan (held-out) dan tidak dipakai untuk melatih model, dan perbaikannya biasanya membentang beberapa file.

Selengkapnya
Contoh
Diberikan sebuah issue nyata dan repositori lengkap, agen harus menghasilkan sebuah patch — yang sering menyentuh banyak file — agar test suite tersembunyi milik proyek lolos. Soal-soal berasal dari repo privat dan komersial secara khusus untuk menghindari kebocoran data pelatihan.
Penilaian
% issue yang terselesaikan, dilaporkan sebagai pass@1 (satu percobaan). Semakin tinggi semakin baik. Skornya lebih rendah dibanding pada SWE-bench Verified karena tugas-tugasnya lebih sulit dan belum pernah dilihat sebelumnya.
Verifikasi
Sepenuhnya otomatis dan disisihkan (held-out): patch yang dihasilkan diterapkan dan unit test tersembunyi asli milik repositori dijalankan di dalam sandbox. Sebuah tugas hanya dihitung jika setiap test target lolos dan tidak ada bagian lain yang mengalami regresi.
Mengapa penting
Dirancang untuk menahan kontaminasi dan saturasi yang menggelembungkan skor pada SWE-bench Verified, sehingga menjadi sinyal yang lebih bersih tentang kemampuan coding-agent yang nyata dan tergeneralisasi pada kode yang belum pernah dilihat model.
Contoh penyelesaian
Tugas
Repositori acme/payments pada base commit yang tetap. Issue: Money('0.05').allocate([1, 1, 1]) kehilangan satu sen — ketiga bagian berjumlah $0.04, bukan $0.05. Hasilkan sebuah patch agar suatu alokasi selalu berjumlah kembali sama dengan nilai aslinya.
Solusi
--- a/payments/money.py
+++ b/payments/money.py
@@ def allocate(self, ratios):
-        total = sum(ratios)
-        return [self._from_minor(self.minor * r // total) for r in ratios]
+        total = sum(ratios)
+        shares = [self.minor * r // total for r in ratios]
+        remainder = self.minor - sum(shares)
+        for i in range(remainder):
+            shares[i] += 1
+        return [self._from_minor(s) for s in shares]
Penjelasan
Pembagian integer memangkas (truncate), sehingga unit minor sisa (sen) hilang tanpa terdeteksi. Perbaikannya menghitung setiap bagian, lalu mendistribusikan sisanya satu unit demi satu unit ke bagian-bagian pertama, menjamin bahwa bagian-bagian yang dialokasikan selalu berjumlah sama dengan totalnya. Test tersembunyi memverifikasi sum(m.allocate(ratios)) == m di beberapa nilai dan rasio.
0 20.5 41 61.5 82 2025-12-11 2026-04-15 2026-08-19 GPT-5.2 Thinking · 55.6 · 2025-12-11 GPT-5.2 Thinking · 55.6 · 2025-12-11 GPT-5.2 Thinking · 55.6 · 2025-12-11 GPT-5.5 · 58.6 · 2026-04-23 GPT-5.5 · 58.6 · 2026-04-23 Claude Opus 4.7 · 64.3 · 2026-04-23 Grok 4.5 · 64.7 · 2026-07-08 Xiaomi-Robotics-U0 · 63.2 · 2026-07-17 Gemini 3.5 Flash-Lite · 54.2 · 2026-07-21 Gemini 3.5 Flash-Lite · 54.2 · 2026-07-21 Gemini 3.5 Flash-Lite · 54.2 · 2026-07-27 OpenForgeClaw · 31.7 · 2026-07-24 OpenForgeClaw · 55.9 · 2026-07-24 KAT-Coder-V2.5 · 65.2 · 2026-07-26 Qwen3.8-Max · 67.7 · 2026-08-03 Argus · 78 · 2026-08-06 Muse Glimmer · 51.2 · 2026-08-10 Ornith-1.5 · 65.1 · 2026-08-19
GPT-5.2 Thinking GPT-5.5 Claude Opus 4.7 Grok 4.5 Xiaomi-Robotics-U0 Gemini 3.5 Flash-Lite OpenForgeClaw KAT-Coder-V2.5 Qwen3.8-Max Argus Muse Glimmer Ornith-1.5
Linimasa
Tanggal Model Skor Sumber
2026-08-19 Ornith-1.5 65.1% Ornith-1.5 merilis model 9B, 35B-A3B, dan 397B dengan pelatihan peningkatan mandiri
2026-08-10 Muse Glimmer 51.2% Meta merilis Muse Glimmer, model agen berbobot terbuka 30B yang berjalan pada satu GPU konsumen
2026-08-06 Argus 78.0% Argus: Runtime Agentic Serbaguna untuk Penalaran Jangka Panjang
2026-08-03 Qwen3.8-Max 67.7% Alibaba merilis Qwen3.8-Max, model MoE dengan 2,4 triliun parameter
2026-07-27 Gemini 3.5 Flash-Lite 54.2% Google merilis Gemini 3.6 Flash, 3.5 Flash-Lite, dan 3.5 Flash Cyber
2026-07-26 KAT-Coder-V2.5 65.2% KwaiKAT merilis KAT-Coder-V2.5, model koding agentic yang dilatih pada lebih dari 100.000 lingkungan yang dapat diverifikasi
2026-07-24 OpenForgeClaw 55.9% OpenForgeRL memungkinkan pelatihan end-to-end agen berbasis harness di lingkungan apa pun
2026-07-24 OpenForgeClaw 31.7% OpenForgeRL memungkinkan pelatihan end-to-end agen berbasis harness di lingkungan apa pun
2026-07-21 Gemini 3.5 Flash-Lite 54.2% Google merilis Gemini 3.6 Flash, 3.5 Flash-Lite, dan 3.5 Flash Cyber untuk beban kerja agentic
2026-07-21 Gemini 3.5 Flash-Lite 54.2% Google merilis Gemini 3.6 Flash, 3.5 Flash-Lite, dan 3.5 Flash Cyber
2026-07-17 Xiaomi-Robotics-U0 63.2% Xiaomi merilis U0, model 38B-parameter untuk sintesis terpadu berbadan
2026-07-08 Grok 4.5 64.7% xAI merilis Grok 4.5 dengan biaya rendah dan kinerja benchmark campuran
2026-04-23 GPT-5.5 58.6% OpenAI merilis GPT-5.5 dan GPT-5.5 Pro melalui API
2026-04-23 GPT-5.5 58.6% OpenAI merilis GPT-5.5 dengan kemampuan agentic dan penggandaan harga API
2026-04-23 Claude Opus 4.7 64.3% OpenAI merilis GPT-5.5 dengan kemampuan agentic dan penggandaan harga API
2025-12-11 GPT-5.2 Thinking 55.6% OpenAI memperkenalkan GPT-5.2 dengan kemampuan coding, konteks panjang, dan penalaran yang ditingkatkan
2025-12-11 GPT-5.2 Thinking 55.6% OpenAI merilis GPT-5.2, mengungguli Gemini 3 dalam benchmark pemrograman dan penalaran
2025-12-11 GPT-5.2 Thinking 55.6% OpenAI memperkenalkan GPT-5.2 dengan kemampuan kerja pengetahuan profesional terkini