Benchmark · agentic

SWE-bench Multilingual

7 hasil 5 model

SWE-bench Multilingual mengukur apakah agen pengodean AI dapat menyelesaikan issue GitHub nyata dengan menyunting repositori kode di berbagai bahasa pemrograman. Skornya adalah % Resolved: proporsi dari 300 tugas yang perbaikannya lolos pengujian milik proyek itu sendiri.

Selengkapnya
Contoh
Tipe tugas: agen diberi laporan bug dari repositori open-source nyata (misalnya proyek Go, Java, atau Ruby) beserta basis kode pada commit sebelum perbaikan, dan harus menghasilkan patch yang menyunting satu atau beberapa berkas untuk menghilangkan masalah yang dijelaskan — tanpa solusi acuan.
Penilaian
Metriknya adalah % Resolved: masing-masing dari 300 instance dinilai lolos/gagal, dan skornya adalah persentase yang lolos. Sebuah instance lolos hanya jika, setelah patch agen diterapkan, semua uji Fail-to-Pass (yang menyasar bug) lolos dan semua uji Pass-to-Pass (perilaku yang ada) tetap lolos.
Verifikasi
Patch diverifikasi dengan menjalankan rangkaian uji repositori di dalam container terisolasi: uji Fail-to-Pass yang ditentukan harus kini lolos dan semua uji Pass-to-Pass harus tetap lolos. Setiap kegagalan, error, atau patch yang tak dapat diterapkan menandai instance sebagai belum terselesaikan; tidak ada nilai parsial.
Mengapa penting
Ia menguji kemampuan pengodean di luar Python pada 9 bahasa dan 42 repositori nyata, dan mengungkap bahwa model menyelesaikan jauh lebih sedikit issue pada bahasa seperti Go, Rust, atau PHP dibanding Python — uji yang lebih jujur atas generalisasi rekayasa perangkat lunak lintas bahasa.
Contoh penyelesaian
Tugas
Instance ilustratif yang representatif. Repositori: pustaka utilitas string Go pada commit sebelum perbaikan. Issue: Reverse() panic / mengembalikan teks rusak pada string dengan karakter UTF-8 multibyte. Uji Fail-to-Pass TestReverseUnicode mengharapkan Reverse("héllo") == "olléh". Agen hanya menerima teks issue dan repositori — tanpa patch acuan.
Solusi
func Reverse(s string) string {
	r := []rune(s)
	for i, j := 0, len(r)-1; i < j; i, j = i+1, j-1 {
		r[i], r[j] = r[j], r[i]
	}
	return string(r)
}
Penjelasan
Kode asli membalik string byte demi byte, yang memecah rune UTF-8 multibyte dan merusak karakter seperti é; mengonversi ke slice []rune lalu menukar kedua ujungnya membalik berdasarkan titik kode Unicode, sehingga Reverse("héllo") menghasilkan "olléh". Penilaian: diterima hanya jika uji TestReverseUnicode (Fail-to-Pass) kini lolos dan semua uji Pass-to-Pass tetap lolos di dalam container.
0 21 42 63 84 2025-07-11 2026-01-15 2026-07-22 Kimi K2 · 47.3 · 2025-07-11 Kimi K2 · 47.3 · 2025-07-28 Kimi K2 · 47.3 · 2025-07-28 Kimi K2-Instruct · 47.3 · 2025-07-11 Kimi K2 Thinking · 61.1 · 2025-11-07 Composer 2 · 73.7 · 2026-03-27 Laguna S 2.1 · 78.5 · 2026-07-22
Kimi K2 Kimi K2-Instruct Kimi K2 Thinking Composer 2 Laguna S 2.1
Linimasa
Tanggal Model Skor Sumber
2026-07-22 Laguna S 2.1 78.5% Poolside merilis Laguna S 2.1, model koding agentic dengan bobot terbuka
2026-03-27 Composer 2 73.7% Cursor merilis laporan teknis Composer 2 tentang pelatihan model coding agentic
2025-11-07 Kimi K2 Thinking 61.1% Moonshot AI merilis Kimi K2 Thinking, model penalaran open-source 1T parameter
2025-07-28 Kimi K2 47.3% Moonshot merilis Kimi K2, model MoE agentic terbuka dengan 32B parameter aktif
2025-07-28 Kimi K2 47.3% Kimi K2: model MoE terbuka dengan 1T parameter dan pengoptimal MuonClip
2025-07-11 Kimi K2 47.3% Moonshot AI merilis Kimi K2, model MoE 1T parameter dengan kemampuan agentic
2025-07-11 Kimi K2-Instruct 47.3% Moonshot AI merilis Kimi-K2-Instruct, model MoE 1T parameter dengan kemampuan agentic