Benchmark · coding

MBPP+

saturated 0 hasil 0 model

MBPP+ adalah versi benchmark pemrograman MBPP (Mostly Basic Python Problems) dengan rangkaian pengujian yang diperluas secara ketat, dibangun dengan kerangka EvalPlus. Ia mengukur kebenaran fungsional fungsi Python yang dihasilkan model dan dilaporkan sebagai pass@1.

Selengkapnya
Contoh
Item tipikal memberikan deskripsi bahasa alami singkat tentang fungsi Python dasar yang harus ditulis (misalnya, 'temukan elemen bersama dari dua daftar'), disertai beberapa contoh assertion yang menetapkan perilaku yang diharapkan.
Penilaian
Metriknya adalah pass@k, biasanya pass@1: sebuah tugas dihitung selesai hanya jika fungsi yang dihasilkan lolos semua pengujian; skornya adalah persentase tugas yang terselesaikan. pass@k dihitung dengan estimator tak bias standar atas n hasil penyelesaian yang disampel.
Verifikasi
Setiap fungsi kandidat dijalankan dalam sandbox terhadap seluruh rangkaian — assertion asli MBPP ditambah input yang dihasilkan otomatis oleh EvalPlus (mutasi sadar-tipe dan penyemaian LLM, kira-kira 35 kali lebih banyak pengujian daripada MBPP). Ia diterima untuk sebuah tugas hanya jika lolos semua pengujian dalam batas waktu.
Mengapa penting
MBPP asli hanya menyertakan sekitar tiga pengujian per soal, sehingga kode yang keliru secara halus bisa lolos sebagai positif palsu. MBPP+ memperketat evaluasi, sehingga tingkat kelulusan yang dipublikasikan dan peringkat model mencerminkan kebenaran nyata, bukan pengujian yang lemah.
Contoh penyelesaian
Tugas
Tulis sebuah fungsi yang menemukan elemen bersama dari dua daftar yang diberikan dan mengembalikannya sebagai daftar terurut berisi nilai-nilai unik. Kode Anda harus lolos pengujian seperti: assert shared_elements([1, 2, 3, 4], [3, 4, 5, 6]) == [3, 4]
Solusi
```python
def shared_elements(list1, list2):
    return sorted(set(list1) & set(list2))
```
Penjelasan
Mengiris kedua daftar sebagai himpunan lalu mengurutkannya menghasilkan nilai bersama yang unik secara terurut, memenuhi assertion. MBPP+ juga menjalankan banyak input tambahan (daftar kosong, duplikat, kasus lebih besar); dengan penilaian pass@1, solusi hanya dihitung jika lolos semuanya.

Belum ada skor terverifikasi yang dilaporkan untuk benchmark ini.