Benchmark · coding

Codeforces (Elo)

10 hasil 10 model

Codeforces (Elo) mengukur kemampuan competitive programming sebuah model dengan menyuruhnya menyelesaikan soal kontes berbatas waktu, dan dinyatakan sebagai rating Elo Codeforces (kira-kira 0–4000, di mana sekitar 2000+ sudah tergolong kuat).

Selengkapnya
Contoh
Item yang umum adalah soal algoritma berbatas waktu — misalnya, membaca input sebuah soal dan mencetak jawaban yang benar dalam batas waktu dan memori yang ketat, menggunakan teknik seperti penelusuran graf, pemrograman dinamis, atau algoritma greedy.
Penilaian
Hasilnya adalah satu angka Elo yang dihitung dari berapa banyak soal kontes yang diselesaikan model dan tingkat kesulitannya, lalu ditempatkan pada skala rating yang sama yang dipakai Codeforces untuk peserta manusia.
Verifikasi
Setiap solusi yang dikirim dinilai secara otomatis: kode dikompilasi dan dijalankan terhadap sekumpulan kasus uji tersembunyi, dan hanya dihitung selesai jika menghasilkan keluaran yang benar dalam batas waktu dan memori.
Mengapa penting
Ia mencerminkan penalaran algoritmik berlangkah banyak dan kemampuan menulis kode yang benar dan efisien di bawah batasan, serta memetakan keterampilan coding sebuah model ke skala rating yang sudah dipahami orang.
Contoh penyelesaian
Tugas
Watermelon: diberikan bilangan bulat w (1 ≤ w ≤ 100), berat sebuah semangka; tentukan apakah semangka itu dapat dibagi menjadi dua bagian sehingga masing-masing berbobot bilangan genap positif dalam kilogram. Cetak «YES» atau «NO».
Solusi
w = int(input())
print("YES" if w > 2 and w % 2 == 0 else "NO")
Penjelasan
Jumlah dua bilangan genap positif juga genap dan minimal 4, sehingga pembagian yang sah ada tepat ketika w genap dan w > 2 (misalnya w=8 → 2+6). Codeforces menilai dengan mengompilasi kiriman dan menjalankannya terhadap kasus uji tersembunyi, menuntut keluaran stdout yang persis sesuai dalam batas waktu dan memori.
88 1016 1944 2872 3800 2024-09-12 2025-08-14 2026-07-16 o1 · 1807 · 2024-09-12 OpenAI o1-preview · 89 · 2024-10-01 o3 · 2727 · 2024-12-20 QwQ-32B-Preview · 1261 · 2025-01-02 o1-mini · 1578 · 2025-01-02 DeepSeek-R1 · 2029 · 2025-01-22 o4-mini · 2719 · 2025-04-17 Qwen3-235B-A22B · 2056 · 2025-05-14 Gemini 3 Deep Think · 3455 · 2026-02-12 GFlowRL · 2048 · 2026-07-16
o1 OpenAI o1-preview o3 QwQ-32B-Preview o1-mini DeepSeek-R1 o4-mini Qwen3-235B-A22B Gemini 3 Deep Think GFlowRL
Linimasa
Tanggal Model Skor Sumber
2026-07-16 GFlowRL 2048.0Elo Microsoft merilis GFlowRL, RL gaya GFlowNet yang stabil untuk model bahasa besar
2026-02-12 Gemini 3 Deep Think 3455.0Elo Google merilis Gemini 3 Deep Think yang ditingkatkan dengan skor benchmark baru
2025-05-14 Qwen3-235B-A22B 2056.0Elo Qwen3 memperkenalkan mode berpikir terpadu dan dukungan 119 bahasa
2025-04-17 o4-mini 2719.0Elo OpenAI merilis o4-mini, model penalaran multimodal yang lebih cepat dan murah
2025-01-22 DeepSeek-R1 2029.0Elo DeepSeek merilis model penalaran R1 melalui pembelajaran penguatan
2025-01-02 QwQ-32B-Preview 1261.0Elo CodeElo memperkenalkan benchmark generasi kode tingkat kompetisi dengan peringkat Elo yang sebanding dengan manusia
2025-01-02 o1-mini 1578.0Elo CodeElo memperkenalkan benchmark generasi kode tingkat kompetisi dengan peringkat Elo yang sebanding dengan manusia
2024-12-20 o3 2727.0Elo OpenAI merilis model o3 dengan kinerja tinggi dalam penalaran dan pemrograman
2024-10-01 OpenAI o1-preview 89.0Elo Membandingkan OpenAI o1 dengan Model Teratas Lainnya
2024-09-12 o1 1807.0Elo OpenAI merilis o1-preview, model penalaran yang melampaui pakar manusia pada benchmark matematika dan sains