Benchmark · agentic

Terminal-Bench

27 hasil 17 model

Terminal-Bench mengukur seberapa baik agen AI menyelesaikan tugas command-line nyata di terminal, seperti memasang perangkat lunak, debugging, dan operasi sistem. Skornya adalah persentase tugas yang berhasil diselesaikan agen.

Selengkapnya
Contoh
Tugas yang khas memberi agen sebuah environment yang rusak atau kosong dan memintanya mencapai kondisi berfungsi — misalnya memasang dependency yang tepat dan memperbaiki konfigurasi agar sebuah program berjalan, semuanya melalui perintah terminal.
Penilaian
Setiap tugas dinilai lulus atau gagal berdasarkan apakah agen mencapai kondisi akhir yang diminta, dan skor benchmark adalah persentase tugas yang berhasil diselesaikan dari total.
Verifikasi
Sebuah hasil hanya diterima jika pemeriksaan otomatis di dalam environment terisolasi (sandbox) memastikan hasil yang dituju dari tugas tercapai — bukan lewat suara manusia atau pencocokan teks yang persis.
Mengapa penting
Keterampilan terminal — memasang, debugging, dan mengoperasikan sistem dari command line — adalah inti pekerjaan rekayasa nyata, sehingga benchmark ini menunjukkan apakah agen dapat bertindak secara mandiri dan andal di command line sungguhan. Versi 2.x-nya yang lebih sulit menjaga standar tetap tinggi seiring agen makin baik.
Contoh penyelesaian
Tugas
Di dalam kontainer Docker Terminal-Bench, file /app/access.log berisi log akses Apache. Tulis satu perintah yang menghitung jumlah alamat IP klien yang berbeda (field pertama yang dipisahkan spasi pada setiap baris) dan menyimpan hanya angka itu ke /app/answer.txt.
Solusi
awk '{print $1}' /app/access.log | sort -u | wc -l > /app/answer.txt
Penjelasan
awk mencetak field pertama (IP klien) dari setiap baris log, sort -u menghapus duplikat, dan wc -l menghitung IP unik yang tersisa, hasilnya dialihkan ke /app/answer.txt. Terminal-Bench menilainya dengan menjalankan uji pytest di dalam kontainer yang membaca /app/answer.txt dan memeriksa apakah sama dengan jumlah IP unik yang diketahui.
0 24.5 49 73.5 98 2025-05-22 2025-12-24 2026-07-29 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-23 Claude Sonnet 4 · 35.5 · 2025-05-23 GLM-4.6 · 40.5 · 2025-09-30 Claude Sonnet 4.5 · 50 · 2025-09-30 Claude Opus 4.5 · 59.3 · 2025-11-25 Claude Opus 4.6 · 65.4 · 2026-02-05 Composer 2 · 61.7 · 2026-03-27 GPT-5.6 Sol (ultra mode) · 91.9 · 2026-06-26 GPT-5.6 Sol · 88.8 · 2026-06-26 GLM-5.2 (753B MoE) · 70.8 · 2026-07-08 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 Kimi K2.6 · 73 · 2026-07-29 GPT-5.5 · 69 · 2026-07-29 Kimi K3 · 32 · 2026-07-29
Claude Opus 4 Claude Sonnet 4 GLM-4.6 Claude Sonnet 4.5 Claude Opus 4.5 Claude Opus 4.6 Composer 2 GPT-5.6 Sol (ultra mode) GPT-5.6 Sol GLM-5.2 (753B MoE) RELAI-VCL Meta Harness GEPA baseline agent Kimi K2.6 GPT-5.5 Kimi K3
Linimasa
Tanggal Model Skor Sumber
2026-07-29 Kimi K2.6 73.0% Fireworks AI merilis lapisan perutean Fireworks Nexus untuk pengendalian biaya
2026-07-29 GPT-5.5 69.0% Fireworks AI merilis lapisan perutean Fireworks Nexus untuk pengendalian biaya
2026-07-29 Kimi K3 32.0% Fireworks AI merilis lapisan perutean Fireworks Nexus untuk pengendalian biaya
2026-07-16 baseline agent 58.7% Optimisasi senyawa RELAI-VCL meraih peningkatan pada Terminal-Bench 2.0
2026-07-16 Meta Harness 64.6% Optimisasi senyawa RELAI-VCL meraih peningkatan pada Terminal-Bench 2.0
2026-07-16 GEPA 66.0% Optimisasi senyawa RELAI-VCL meraih peningkatan pada Terminal-Bench 2.0
2026-07-16 RELAI-VCL 76.4% Optimisasi senyawa RELAI-VCL meraih peningkatan pada Terminal-Bench 2.0
2026-07-16 Meta Harness 64.6% RELAI-VCL menggandakan keuntungan agen-pengoptimal melalui pembelajaran berkelanjutan
2026-07-16 RELAI-VCL 76.4% RELAI-VCL menggandakan keuntungan agen-pengoptimal melalui pembelajaran berkelanjutan
2026-07-16 GEPA 66.0% RELAI-VCL menggandakan keuntungan agen-pengoptimal melalui pembelajaran berkelanjutan
2026-07-16 baseline agent 58.7% RELAI-VCL menggandakan keuntungan agen-pengoptimal melalui pembelajaran berkelanjutan
2026-07-16 RELAI-VCL 76.4% RELAI-VCL menggandakan keuntungan agen-optimizer melalui pembelajaran berkelanjutan
2026-07-16 Meta Harness 64.6% RELAI-VCL menggandakan keuntungan agen-optimizer melalui pembelajaran berkelanjutan
2026-07-16 GEPA 66.0% RELAI-VCL menggandakan keuntungan agen-optimizer melalui pembelajaran berkelanjutan
2026-07-16 baseline agent 58.7% RELAI-VCL menggandakan keuntungan agen-optimizer melalui pembelajaran berkelanjutan
2026-07-08 GLM-5.2 (753B MoE) 70.8% GLM-5.2 4-bit pada 4× DGX Spark mencapai 70,8% di Terminal-Bench 2.1
2026-06-26 GPT-5.6 Sol (ultra mode) 91.9% OpenAI meluncurkan GPT-5.6 Sol dengan catatan pemrograman, namun mengakui masalah kecurangan
2026-06-26 GPT-5.6 Sol 88.8% OpenAI meluncurkan GPT-5.6 Sol dengan catatan pemrograman, namun mengakui masalah kecurangan
2026-03-27 Composer 2 61.7pts Cursor merilis laporan teknis Composer 2 tentang pelatihan model coding agentic
2026-02-05 Claude Opus 4.6 65.4% Anthropic merilis Claude Opus 4.6 dengan jendela konteks 1M dan peningkatan agentic
2025-11-25 Claude Opus 4.5 59.3% Anthropic merilis Claude Opus 4.5 dengan kemampuan coding dan penggunaan komputer terkini
2025-09-30 GLM-4.6 40.5% Zhipu AI merilis GLM-4.6 dengan kemampuan agentic dan jendela konteks 128k
2025-09-30 Claude Sonnet 4.5 50.0% Anthropic merilis Claude Sonnet 4.5 dengan kemampuan coding dan agen yang ditingkatkan
2025-05-23 Claude Sonnet 4 35.5% Anthropic merilis Claude Opus 4 dan Sonnet 4 dengan penalaran hibrida
2025-05-23 Claude Opus 4 43.2% Anthropic merilis Claude Opus 4 dan Sonnet 4 dengan penalaran hibrida
2025-05-22 Claude Opus 4 43.2% Anthropic memperkenalkan Claude Opus 4 dan Sonnet 4 dengan pemikiran ekstensif dan penggunaan alat
2025-05-22 Claude Opus 4 43.2% Anthropic merilis Claude Opus 4 dan Sonnet 4 dengan langkah keamanan ASL-3