Benchmark · coding

Aider Polyglot

27 hasil 25 model

Aider Polyglot adalah benchmark penyuntingan kode dari alat pemrograman Aider yang menguji seberapa baik sebuah LLM menyunting kode yang sudah ada di banyak bahasa pemrograman. Skornya adalah persentase tugas yang suntingannya menghasilkan kode benar dan lolos tes tugas tersebut.

Selengkapnya
Contoh
Item tipikal berupa latihan pemrograman bergaya Exercism dalam salah satu dari beberapa bahasa (Python, Rust, Go, Java, JavaScript, atau C++), di mana model harus menyunting berkas sumber yang disediakan untuk mengimplementasikan fungsi yang diminta agar tesnya lolos.
Penilaian
Metriknya adalah persentase tugas yang berhasil diselesaikan: sebuah tugas dihitung hanya jika kode yang disunting lolos semua tes otomatisnya. Aider juga melacak seberapa sering suntingan kembali dalam format yang benar dan dapat diterapkan.
Verifikasi
Hasil diperiksa secara otomatis: berkas yang disunting dijalankan terhadap rangkaian unit test setiap latihan, dan sebuah tugas lolos hanya jika semua tes lolos — tanpa suara manusia maupun perbandingan kecocokan persis.
Mengapa penting
Ini mencerminkan alur kerja pengembang yang nyata — menyunting berkas yang sudah ada di banyak bahasa alih-alih menulis potongan kode dari nol — sehingga menjadi sinyal praktis seberapa berguna sebuah model sebagai asisten pemrograman.
Contoh penyelesaian
Tugas
Aider Polyglot mengambil latihan dari Exercism dalam 6 bahasa: model diberi spesifikasi soal beserta berkas rangka (mis. acronym.py berisi def abbreviate(words): ...) dan harus menyuntingnya agar suite pytest tersembunyi lulus. Contoh spesifikasi: mengubah sebuah frasa menjadi akronimnya — 'Portable Network Graphics' → 'PNG', memperlakukan spasi, tanda hubung, dan garis bawah sebagai pemisah serta mengabaikan tanda baca lainnya.
Solusi
import re

def abbreviate(words):
    return "".join(w[0].upper() for w in re.findall(r"[A-Za-z']+", words))
Penjelasan
Ekspresi reguler mengekstrak token kata (huruf plus apostrof di dalam kata), mengambil huruf pertama tiap token, membuatnya kapital, lalu menggabungkannya sehingga 'Portable Network Graphics' → 'PNG'. Penilaian menjalankan uji unit tersembunyi latihan itu; item baru mendapat nilai jika semua uji lulus (aider melaporkan pass@2 atas seluruh suite).
0 23.5 47 70.5 94 2024-12-21 2025-10-13 2026-08-06 o1 · 62 · 2024-12-21 R1+Sonnet · 64 · 2025-01-24 GPT-4.5 · 45 · 2025-03-05 Gemini 2.5 Pro · 74 · 2025-03-26 Gemini 2.5 Pro · 83.1 · 2026-03-10 GPT-4.1 · 52.9 · 2025-04-14 GPT‑4.1 nano · 9.8 · 2025-04-14 o4-mini-high · 68.9 · 2025-04-17 Qwen3 235B A22B whole, no think, via official Alibaba API · 61.8 · 2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings · 65.3 · 2025-05-08 Claude Opus 4 · 72 · 2025-05-23 Deepseek-R1-0528 · 71.6 · 2025-05-30 Gemini 2.5 06-05 · 82.2 · 2025-06-05 Grok 4 Heavy · 79.6 · 2025-07-10 GPT-5 · 88 · 2025-08-07 GPT-5 · 88 · 2025-08-07 GPT‑5 · 88 · 2025-08-07 DeepSeek V3.1 · 71.6 · 2025-08-20 Qwen3-Coder-480B-A35B-Instruct · 61.8 · 2025-10-17 GPT-5 with high reasoning effort · 88 · 2026-03-10 o3-pro · 84.9 · 2026-03-10 Claude Sonnet 4 · 61 · 2026-03-10 GPT-5 with medium reasoning · 81.3 · 2026-03-10 o4-mini · 80.8 · 2026-03-10 Argus · 76.8 · 2026-08-06 DeepSeek R1 · 56.9 · 2025-01-20 Claude 3.7 Sonnet · 64.9 · 2025-02-24
o1 R1+Sonnet GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 nano o4-mini-high Qwen3 235B A22B whole, no think, via official Alibaba API Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings Claude Opus 4 Deepseek-R1-0528 Gemini 2.5 06-05 Grok 4 Heavy GPT-5 GPT‑5 DeepSeek V3.1 Qwen3-Coder-480B-A35B-Instruct GPT-5 with high reasoning effort o3-pro Claude Sonnet 4 GPT-5 with medium reasoning o4-mini Argus DeepSeek R1 Claude 3.7 Sonnet
Linimasa
Tanggal Model Skor Sumber
2026-08-06 Argus 76.8% Argus: Runtime Agentic Serbaguna untuk Penalaran Jangka Panjang
2026-03-10 GPT-5 with high reasoning effort 88.0% GPT-5 memimpin benchmark Aider Polyglot dengan skor 88% menggunakan upaya penalaran tinggi
2026-03-10 o3-pro 84.9% GPT-5 memimpin benchmark Aider Polyglot dengan skor 88% menggunakan upaya penalaran tinggi
2026-03-10 Gemini 2.5 Pro 83.1% GPT-5 memimpin benchmark Aider Polyglot dengan skor 88% menggunakan upaya penalaran tinggi
2026-03-10 Claude Sonnet 4 61.0% GPT-5 memimpin benchmark Aider Polyglot dengan skor 88% menggunakan upaya penalaran tinggi
2026-03-10 GPT-5 with medium reasoning 81.3% GPT-5 memimpin benchmark Aider Polyglot dengan skor 88% menggunakan upaya penalaran tinggi
2026-03-10 o4-mini 80.8% GPT-5 memimpin benchmark Aider Polyglot dengan skor 88% menggunakan upaya penalaran tinggi
2025-10-17 Qwen3-Coder-480B-A35B-Instruct 61.8% Alibaba merilis Qwen3-Coder-480B-A35B-Instruct, model pemrograman open-source yang menyamai kinerja proprietary
2025-08-20 DeepSeek V3.1 71.6% DeepSeek merilis model penalaran hibrida V3.1 dengan tingkat kelolosan Aider 71,6%
2025-08-07 GPT-5 88.0% OpenAI memperkenalkan GPT-5 dengan routing terpadu dan penalaran tingkat ahli
2025-08-07 GPT-5 88.0% OpenAI meluncurkan GPT-5 dengan penalaran adaptif dan arsitektur terpadu
2025-08-07 GPT‑5 88.0% OpenAI merilis API GPT-5 dengan peningkatan coding dan agentic
2025-07-10 Grok 4 Heavy 79.6% xAI merilis Grok 4 dengan tier multi-agent berat dan data web langsung
2025-06-05 Gemini 2.5 06-05 82.2% Google merilis pratinjau Gemini 2.5 06-05 dengan peningkatan pemrograman dan penalaran
2025-05-30 Deepseek-R1-0528 71.6% DeepSeek memperbarui model R1 dengan penalaran dan skor benchmark yang lebih baik
2025-05-23 Claude Opus 4 72.0% Anthropic merilis Claude Opus 4 dan Sonnet 4 dengan penalaran hibrida
2025-05-08 Qwen3 235B A22B whole, no think, via official Alibaba API 61.8% Hasil benchmark Qwen3 menunjukkan kinerja pemrograman di berbagai penyedia
2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings 65.3% Hasil benchmark Qwen3 menunjukkan kinerja pemrograman di berbagai penyedia
2025-04-17 o4-mini-high 68.9% OpenAI merilis o4-mini, model penalaran multimodal yang lebih cepat dan murah
2025-04-14 GPT-4.1 52.9% OpenAI merilis keluarga GPT-4.1 dengan konteks 1M token dan peningkatan pemrograman
2025-04-14 GPT‑4.1 nano 9.8% OpenAI meluncurkan GPT-4.1, GPT-4.1 mini, dan GPT-4.1 nano di API
2025-03-26 Gemini 2.5 Pro 74.0% Google merilis model penalaran Gemini 2.5 Pro eksperimental dengan konteks 1M token
2025-03-05 GPT-4.5 45.0% OpenAI merilis GPT-4.5, model terbesarnya, untuk ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 64.9% Aider leaderboard
2025-01-24 R1+Sonnet 64.0% R1+Sonnet menetapkan SOTA baru pada benchmark polyglot aider
2025-01-20 DeepSeek R1 56.9% Aider leaderboard
2024-12-21 o1 62.0% OpenAI o1 memimpin papan peringkat pemrograman poliglot baru Aider yang menantang