Benchmark · coding

LiveCodeBench

20 hasil 18 model

LiveCodeBench menilai seberapa baik model bahasa besar menyelesaikan soal competitive programming, menggunakan tantangan koding yang dikumpulkan secara terus-menerus dari kompetisi terbaru untuk menghindari kontaminasi data pelatihan. Metrik utamanya adalah pass@1 — proporsi soal yang diselesaikan dengan benar pada percobaan pertama model.

Selengkapnya
Contoh
Contoh item yang umum adalah soal koding bergaya kompetisi — misalnya, diberikan sebuah array bilangan bulat, tulis sebuah fungsi yang mengembalikan panjang subbarisan naik ketat (strictly increasing) terpanjang — yang harus diselesaikan model dengan menghasilkan kode yang berfungsi.
Penilaian
Setiap solusi yang dihasilkan dijalankan terhadap kasus uji soal tersebut; pass@1 adalah fraksi soal yang pengiriman pertama modelnya lolos semua uji.
Verifikasi
Sebuah solusi diterima secara otomatis ketika kode yang dihasilkan lolos semua kasus uji tersembunyi dan publik untuk soal itu; tidak ada penilaian manusia maupun pencocokan teks persis.
Mengapa penting
Karena soalnya diambil dari kompetisi yang dirilis setelah batas waktu pelatihan sebuah model, LiveCodeBench mengukur kemampuan penalaran dan koding yang sebenarnya, bukan jawaban hafalan, sehingga menjadi tolok ukur keterampilan koding yang tepercaya dan tahan kontaminasi.
Contoh penyelesaian
Tugas
Gaya pemrograman kompetitif (stdin/stdout). Diberikan n bilangan bulat, hitung pasangan (i, j) dengan i < j sehingga nums[i] + nums[j] genap. Masukan: baris pertama n, baris kedua n bilangan bulat dipisah spasi; cetak jumlahnya.
Solusi
import sys

def main():
    data = sys.stdin.read().split()
    n = int(data[0])
    nums = list(map(int, data[1:1 + n]))
    odd = sum(x % 2 for x in nums)
    even = n - odd
    print(odd * (odd - 1) // 2 + even * (even - 1) // 2)

main()
Penjelasan
Suatu jumlah genap tepat ketika kedua sukunya berparitas sama, jadi jawabannya adalah C(evens, 2) + C(odds, 2); menghitung paritas berjalan dalam O(n). LiveCodeBench menjalankan program model terhadap uji unit tersembunyi dan menilainya dengan pass@1 — benar hanya jika semua uji lolos.
0 23 46 69 92 2024-07-15 2025-07-10 2026-07-06 Qwen2-72B-Instruct · 35.7 · 2024-07-15 Qwen2-72B-Instruct · 35.7 · 2024-07-15 QwQ-32B-Preview · 50 · 2024-11-28 DeepSeek-R1-Distill-Qwen-32B · 57.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 47.3 · 2025-01-22 Grok 3 (Think) · 79.4 · 2025-02-19 Grok 3 mini · 80.4 · 2025-02-19 Grok 3 · 79.4 · 2025-03-11 DeepSeek-V3-0324 · 49.2 · 2025-03-24 Gemini 2.5 Pro · 70.4 · 2025-03-26 Gemini 2.0 Flash · 34.5 · 2025-04-15 Qwen3-235B-A22B · 70.7 · 2025-05-14 Deepseek-R1-0528 · 73.3 · 2025-05-30 Kimi K2 · 53.7 · 2025-07-28 Kimi K2 · 53.7 · 2025-07-28 GLM-4.6 · 82.8 · 2025-09-30 Kimi K2 Thinking · 83.1 · 2025-11-07 Step 3.5 Flash · 86.4 · 2026-02-10 Grok 4 · 81.9 · 2026-02-25 Agents-A1 · 44.3 · 2026-07-06
Qwen2-72B-Instruct QwQ-32B-Preview DeepSeek-R1-Distill-Qwen-32B Kimi k1.5 (short-CoT) Grok 3 (Think) Grok 3 mini Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro Gemini 2.0 Flash Qwen3-235B-A22B Deepseek-R1-0528 Kimi K2 GLM-4.6 Kimi K2 Thinking Step 3.5 Flash Grok 4 Agents-A1
Linimasa
Tanggal Model Skor Sumber
2026-07-06 Agents-A1 44.3pts Memperluas Horizon, Bukan Parameter: Mencapai Kinerja Triliun-Parameter dengan Agen 35B
2026-02-25 Grok 4 81.9% xAI merilis model penalaran Grok 4 dengan benchmark agentic dan coding yang kuat
2026-02-10 Step 3.5 Flash 86.4% Langkah 3.5 Flash: model MoE aktif 11B mencapai kinerja agentic tingkat terdepan
2025-11-07 Kimi K2 Thinking 83.1% Moonshot AI merilis Kimi K2 Thinking, model penalaran open-source 1T parameter
2025-09-30 GLM-4.6 82.8% Zhipu AI merilis GLM-4.6 dengan kemampuan agentic dan jendela konteks 128k
2025-07-28 Kimi K2 53.7% Kimi K2: model MoE terbuka dengan 1T parameter dan pengoptimal MuonClip
2025-07-28 Kimi K2 53.7% Moonshot merilis Kimi K2, model MoE agentic terbuka dengan 32B parameter aktif
2025-05-30 Deepseek-R1-0528 73.3% DeepSeek memperbarui model R1 dengan penalaran dan skor benchmark yang lebih baik
2025-05-14 Qwen3-235B-A22B 70.7% Qwen3 memperkenalkan mode berpikir terpadu dan dukungan 119 bahasa
2025-04-15 Gemini 2.0 Flash 34.5% Google merilis Gemini 2.0 Flash dengan kualitas yang ditingkatkan dan kecepatan dua kali lipat dari Gemini 1.5 Pro
2025-03-26 Gemini 2.5 Pro 70.4% Google merilis model penalaran Gemini 2.5 Pro eksperimental dengan konteks 1M token
2025-03-24 DeepSeek-V3-0324 49.2% DeepSeek-V3-0324 meningkatkan kemampuan penalaran, pemrograman, dan penulisan bahasa Mandarin dibandingkan DeepSeek-V3
2025-03-11 Grok 3 79.4% xAI merilis Grok 3 dengan penalaran mendalam dan konteks jutaan token
2025-02-19 Grok 3 (Think) 79.4% xAI merilis Grok 3 Beta dan agen DeepSearch
2025-02-19 Grok 3 mini 80.4% xAI merilis Grok 3 Beta dan agen DeepSearch
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 57.2% DeepSeek merilis model penalaran R1 melalui pembelajaran penguatan
2025-01-22 Kimi k1.5 (short-CoT) 47.3% Kimi k1.5 menskalakan pembelajaran penguatan dengan LLM untuk menyamai o1 dan mengalahkan model short-CoT
2024-11-28 QwQ-32B-Preview 50.0% Qwen merilis QwQ-32B-Preview, model penalaran eksperimental
2024-07-15 Qwen2-72B-Instruct 35.7% Tim Qwen merilis seri Qwen2 dengan model padat dan MoE 72B
2024-07-15 Qwen2-72B-Instruct 35.7% Laporan Teknis Qwen2 memperkenalkan model padat dan MoE hingga 72B