Benchmark · agentic
SWE-bench Multilingual
SWE-bench Multilingual mengukur apakah agen pengodean AI dapat menyelesaikan issue GitHub nyata dengan menyunting repositori kode di berbagai bahasa pemrograman. Skornya adalah % Resolved: proporsi dari 300 tugas yang perbaikannya lolos pengujian milik proyek itu sendiri.
Selengkapnya
- Contoh
- Tipe tugas: agen diberi laporan bug dari repositori open-source nyata (misalnya proyek Go, Java, atau Ruby) beserta basis kode pada commit sebelum perbaikan, dan harus menghasilkan patch yang menyunting satu atau beberapa berkas untuk menghilangkan masalah yang dijelaskan — tanpa solusi acuan.
- Penilaian
- Metriknya adalah % Resolved: masing-masing dari 300 instance dinilai lolos/gagal, dan skornya adalah persentase yang lolos. Sebuah instance lolos hanya jika, setelah patch agen diterapkan, semua uji Fail-to-Pass (yang menyasar bug) lolos dan semua uji Pass-to-Pass (perilaku yang ada) tetap lolos.
- Verifikasi
- Patch diverifikasi dengan menjalankan rangkaian uji repositori di dalam container terisolasi: uji Fail-to-Pass yang ditentukan harus kini lolos dan semua uji Pass-to-Pass harus tetap lolos. Setiap kegagalan, error, atau patch yang tak dapat diterapkan menandai instance sebagai belum terselesaikan; tidak ada nilai parsial.
- Mengapa penting
- Ia menguji kemampuan pengodean di luar Python pada 9 bahasa dan 42 repositori nyata, dan mengungkap bahwa model menyelesaikan jauh lebih sedikit issue pada bahasa seperti Go, Rust, atau PHP dibanding Python — uji yang lebih jujur atas generalisasi rekayasa perangkat lunak lintas bahasa.
Contoh penyelesaian
Tugas
Instance ilustratif yang representatif. Repositori: pustaka utilitas string Go pada commit sebelum perbaikan. Issue:
Reverse() panic / mengembalikan teks rusak pada string dengan karakter UTF-8 multibyte. Uji Fail-to-Pass TestReverseUnicode mengharapkan Reverse("héllo") == "olléh". Agen hanya menerima teks issue dan repositori — tanpa patch acuan.Solusi
func Reverse(s string) string {
r := []rune(s)
for i, j := 0, len(r)-1; i < j; i, j = i+1, j-1 {
r[i], r[j] = r[j], r[i]
}
return string(r)
}
Penjelasan
Kode asli membalik string byte demi byte, yang memecah rune UTF-8 multibyte dan merusak karakter seperti
é; mengonversi ke slice []rune lalu menukar kedua ujungnya membalik berdasarkan titik kode Unicode, sehingga Reverse("héllo") menghasilkan "olléh". Penilaian: diterima hanya jika uji TestReverseUnicode (Fail-to-Pass) kini lolos dan semua uji Pass-to-Pass tetap lolos di dalam container.| Tanggal | Model | Skor | Sumber |
|---|---|---|---|
| 2026-07-22 | Laguna S 2.1 | 78.5% | Poolside merilis Laguna S 2.1, model koding agentic dengan bobot terbuka |
| 2026-03-27 | Composer 2 | 73.7% | Cursor merilis laporan teknis Composer 2 tentang pelatihan model coding agentic |
| 2025-11-07 | Kimi K2 Thinking | 61.1% | Moonshot AI merilis Kimi K2 Thinking, model penalaran open-source 1T parameter |
| 2025-07-28 | Kimi K2 | 47.3% | Moonshot merilis Kimi K2, model MoE agentic terbuka dengan 32B parameter aktif |
| 2025-07-28 | Kimi K2 | 47.3% | Kimi K2: model MoE terbuka dengan 1T parameter dan pengoptimal MuonClip |
| 2025-07-11 | Kimi K2 | 47.3% | Moonshot AI merilis Kimi K2, model MoE 1T parameter dengan kemampuan agentic |
| 2025-07-11 | Kimi K2-Instruct | 47.3% | Moonshot AI merilis Kimi-K2-Instruct, model MoE 1T parameter dengan kemampuan agentic |