| 2026-09-29 |
Gemini 3.5 Flash |
79.0% |
Google Research merilis RRSI untuk mencegah overfitting harness agen AI
|
| 2026-09-29 |
Qwen3.8-Flash-Next Coder |
75.6% |
ISTA merilis GGUF GSQ-RCO untuk Qwen3.8-Flash-Next dan build Coder yang memangkas 50% ahli
|
| 2026-09-29 |
Qwen3.5-4B (with ROFT) |
49.2% |
ROFT meningkatkan model agentic dengan fine-tuning pada penjelasan yang dihasilkan sendiri
|
| 2026-09-28 |
Ember-1 |
92.2% |
Fireworks AI merilis Ember-1, model pasca-pelatihan Kimi K3 yang menggunakan 40% lebih sedikit token
|
| 2026-09-09 |
Qwen Test agent + Repair agent (post-trained) |
72.6% |
ExecCritic menggunakan RL khusus peran untuk meningkatkan agen pemrograman melalui perbaikan yang dipandu pengujian
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCritic menggunakan RL khusus peran untuk meningkatkan agen pemrograman melalui perbaikan yang dipandu pengujian
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCritic menggunakan RL khusus peran untuk meningkatkan agen pemrograman melalui perbaikan yang dipandu pengujian
|
| 2026-09-09 |
base Test agent (no-test baseline) |
57.3% |
ExecCritic menggunakan RL khusus peran untuk meningkatkan agen pemrograman melalui perbaikan yang dipandu pengujian
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCritic menggunakan RL khusus peran untuk meningkatkan agen pemrograman melalui perbaikan yang dipandu pengujian
|
| 2026-09-09 |
Qwen Test agent (post-trained) + Repair agent (post-trained) |
72.6% |
ExecCritic menggunakan RL berbasis peran untuk meningkatkan agen pemrograman melalui perbaikan yang dipandu tes
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCritic menggunakan RL berbasis peran untuk meningkatkan agen pemrograman melalui perbaikan yang dipandu tes
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCritic menggunakan RL berbasis peran untuk meningkatkan agen pemrograman melalui perbaikan yang dipandu tes
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCritic menggunakan RL berbasis peran untuk meningkatkan agen pemrograman melalui perbaikan yang dipandu tes
|
| 2026-09-09 |
base Test agent |
57.3% |
ExecCritic menggunakan RL berbasis peran untuk meningkatkan agen pemrograman melalui perbaikan yang dipandu tes
|
| 2026-09-07 |
K2-Horizon-7B |
70.6% |
IFM merilis K2 Horizon: enam model Apache 2.0 dari 0,9B hingga 375B
|
| 2026-09-07 |
K2-Horizon-3.7B |
68.6% |
IFM merilis K2 Horizon: enam model Apache 2.0 dari 0,9B hingga 375B
|
| 2026-09-02 |
Qwen3.5-9B |
16.6% |
CANOPY memungkinkan Qwen3-14B meraih puncak AppWorld dengan RL berbasis hasil akhir
|
| 2026-08-26 |
Granite 4.2 30B |
57.0% |
IBM merilis Granite 4.2 dengan penalaran asli dan RL agens untuk model perusahaan terbuka
|
| 2026-08-26 |
Granite 4.2 8B |
47.67% |
IBM merilis Granite 4.2 dengan penalaran asli dan RL agens untuk model perusahaan terbuka
|
| 2026-08-20 |
Qwen3.5-9B |
14.6% |
Meta merilis Muse Video dengan audio asli; Stripe mengakuisisi OpenRouter
|
| 2026-08-20 |
Ornith-1.5 |
86.0% |
Z.ai mengusulkan hukum penskalaan pasca-pelatihan dan merilis GLM 5.3; Ornith-1.5 diluncurkan dengan peningkatan diri
|
| 2026-08-19 |
Ornith-1.5 |
86.0% |
Ornith-1.5 merilis model 9B, 35B-A3B, dan 397B dengan pelatihan peningkatan mandiri
|
| 2026-08-18 |
Qwen3.5-27B |
74.8% |
Agen Kozuchi menyelesaikan 374 instance SWE-bench Verified menggunakan Qwen3.5-27B
|
| 2026-08-10 |
Qwen3.6-27B |
77.2% |
Meta merilis Muse Glimmer, model agen berbobot terbuka 30B yang berjalan pada satu GPU konsumen
|
| 2026-08-03 |
Orchard-SWE |
69.7% |
Microsoft Research merilis kerangka kerja Orchard untuk AI agenik yang skalabel
|
| 2026-08-03 |
Inkling-Small |
80.2% |
Thinking Machines Lab merilis Inkling-Small, model MoE multimodal dengan bobot terbuka 276B
|
| 2026-07-24 |
Claude Opus 5 |
96.0% |
Anthropic merilis Claude Opus 5 dengan pemikiran bawaan dan peningkatan coding agentic
|
| 2026-07-19 |
DeepSeek V4 Pro |
80.6% |
Kimi K3, DeepSeek V4 Pro, dan GLM-5.2 dibandingkan pada benchmark, lisensi, dan biaya penyajian
|
| 2026-07-17 |
Devstral 2 |
72.2% |
Mistral Vibe for Code memimpin empat agen pemrograman dalam tugas scaffold-ke-PR
|
| 2026-07-17 |
Devstral Small 2 |
68.0% |
Mistral Vibe for Code memimpin empat agen pemrograman dalam tugas scaffold-ke-PR
|
| 2026-07-14 |
Qwen3.5-35B-A3B |
6.0% |
UMoE menata ulang kumpulan ahli MoE untuk penyetelan halus spesifik domain yang lebih baik
|
| 2026-07-14 |
Qwen3-30B-A3B |
6.0% |
UMoE menata ulang kumpulan ahli MoE untuk penyetelan halus spesifik domain yang lebih baik
|
| 2026-07-07 |
LLM-as-a-Verifier |
78.2% |
LLM-as-a-Verifier memperkenalkan kerangka verifikasi serbaguna dengan skor kontinu
|
| 2026-04-25 |
Qwen3.6-27B |
77.2% |
Alibaba merilis Qwen3.6-27B, mengungguli pendahulu yang lebih besar dalam benchmark pemrograman
|
| 2026-04-24 |
V4-Pro-Max |
80.6% |
DeepSeek merilis V4 dengan arsitektur konteks panjang yang efisien untuk agen
|
| 2026-03-25 |
o3 |
71.7% |
OpenAI mengumumkan pensiunnya o3 dari ChatGPT dan membagikan skor benchmark
|
| 2026-02-17 |
Claude Sonnet 4.6 |
79.6% |
Anthropic merilis Claude Sonnet 4.6 dengan peningkatan coding, penggunaan komputer, dan konteks 1M token
|
| 2026-02-05 |
Claude Opus 4.6 |
80.8% |
Anthropic merilis Claude Opus 4.6 dengan jendela konteks 1M dan peningkatan agentic
|
| 2026-02-01 |
Claude Opus 4.6 |
80.8% |
Benchmark yang telah didekontaminasi mengungkap kesenjangan 12 poin antara model pemrograman AI teratas
|
| 2026-02-01 |
MiniMax M2.5 |
80.2% |
Benchmark yang telah didekontaminasi mengungkap kesenjangan 12 poin antara model pemrograman AI teratas
|
| 2026-01-28 |
Qwen3.6-27B |
77.2% |
Qwen 3.6-27B dan DeepSeek V4 Flash memimpin benchmark pemrograman lokal
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI merilis GPT-5.2, mengungguli Gemini 3 dalam benchmark pemrograman dan penalaran
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI memperkenalkan GPT-5.2 dengan kemampuan kerja pengetahuan profesional terkini
|
| 2025-12-09 |
Devstral 2 |
72.2% |
Mistral merilis model coding Devstral 2 dan Mistral Vibe CLI
|
| 2025-12-09 |
Devstral Small 2 |
68.0% |
Mistral merilis model coding Devstral 2 dan Mistral Vibe CLI
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
77.9% |
OpenAI menjadikan GPT-5.1-Codex-Max sebagai default di Codex CLI
|
| 2025-11-19 |
Kimi K2 Thinking |
71.3% |
Moonshot AI merilis Kimi K2 Thinking dengan penggunaan alat agentic
|
| 2025-11-07 |
Kimi K2 Thinking |
71.3% |
Moonshot AI merilis Kimi K2 Thinking, model penalaran open-source 1T parameter
|
| 2025-09-30 |
Claude Sonnet 4.5 |
77.2% |
Anthropic merilis Claude Sonnet 4.5 dengan kemampuan coding dan agen yang ditingkatkan
|
| 2025-09-29 |
Claude Sonnet 4.5 |
77.2% |
Anthropic
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI meluncurkan GPT-5 terpadu dengan penataan rute waktu nyata dan akses gratis
|
| 2025-08-07 |
GPT‑5 |
74.9% |
OpenAI merilis API GPT-5 dengan peningkatan coding dan agentic
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI memperkenalkan GPT-5 dengan routing terpadu dan penalaran tingkat ahli
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI meluncurkan GPT-5 dengan penalaran adaptif dan arsitektur terpadu
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI
|
| 2025-08-06 |
GLM-4.5 |
64.2% |
Zhipu AI merilis model GLM-4.5 yang setara dengan Claude dan DeepSeek
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Moonshot merilis Kimi K2, model MoE agentic terbuka dengan 32B parameter aktif
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Kimi K2: model MoE terbuka dengan 1T parameter dan pengoptimal MuonClip
|
| 2025-07-11 |
Kimi K2-Instruct |
65.8% |
Moonshot AI merilis Kimi-K2-Instruct, model MoE 1T parameter dengan kemampuan agentic
|
| 2025-07-11 |
Kimi K2 |
65.8% |
Moonshot AI merilis Kimi K2, model MoE 1T parameter dengan kemampuan agentic
|
| 2025-07-10 |
Devstral Medium |
61.6% |
Mistral AI merilis Devstral Small 1.1 dan Devstral Medium bersama All Hands AI
|
| 2025-07-10 |
Devstral Small 1.1 |
53.6% |
Mistral AI merilis Devstral Small 1.1 dan Devstral Medium bersama All Hands AI
|
| 2025-05-30 |
Deepseek-R1-0528 |
57.6% |
DeepSeek memperbarui model R1 dengan penalaran dan skor benchmark yang lebih baik
|
| 2025-05-23 |
Claude Sonnet 4 |
72.7% |
Anthropic merilis Claude Opus 4 dan Sonnet 4 dengan penalaran hibrida
|
| 2025-05-23 |
Claude Opus 4 |
72.5% |
Anthropic merilis Claude Opus 4 dan Sonnet 4 dengan penalaran hibrida
|
| 2025-05-22 |
Claude Opus 4 |
72.5% |
Anthropic
|
| 2025-05-21 |
Devstral |
46.8% |
Mistral AI merilis Devstral, LLM agentic untuk rekayasa perangkat lunak
|
| 2025-04-17 |
o4-mini |
68.1% |
OpenAI merilis o4-mini, model penalaran multimodal yang lebih cepat dan murah
|
| 2025-04-16 |
OpenAI o3 |
71.7% |
OpenAI
|
| 2025-04-14 |
GPT-4.1 |
54.6% |
OpenAI merilis keluarga GPT-4.1 dengan konteks 1M token dan peningkatan pemrograman
|
| 2025-04-14 |
GPT‑4.1 |
54.6% |
OpenAI meluncurkan GPT-4.1, GPT-4.1 mini, dan GPT-4.1 nano di API
|
| 2025-03-26 |
Gemini 2.5 Pro |
63.8% |
Google merilis model penalaran Gemini 2.5 Pro eksperimental dengan konteks 1M token
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google memperkenalkan model eksperimental Gemini 2.5 Pro
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google memperkenalkan model berpikir Gemini 2.5 Pro
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google DeepMind
|
| 2025-03-05 |
GPT-4.5 |
38.0% |
OpenAI merilis GPT-4.5, model terbesarnya, untuk ChatGPT Plus
|
| 2025-02-24 |
Claude 3.7 Sonnet |
62.3% |
Anthropic
|
| 2025-01-06 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 Sonnet mencapai 49% pada SWE-bench Verified
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI merilis model o3 dengan kinerja tinggi dalam penalaran dan pemrograman
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI memamerkan model penalaran o3 dengan terobosan ARC AGI dan Frontier Math
|
| 2024-10-30 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 Sonet mencapai skor 49% pada SWE-bench Verified dengan perancah agen yang minimal
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic meningkatkan Claude 3.5 Sonnet, merilis Claude 3.5 Haiku dan beta penggunaan komputer
|
| 2024-10-22 |
Claude 3.5 Haiku |
40.6% |
Anthropic meningkatkan Claude 3.5 Sonnet, merilis Claude 3.5 Haiku dan beta penggunaan komputer
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic
|
| 2024-08-13 |
Agentless |
32.0% |
OpenAI merilis SWE-bench Verified dengan subset yang divalidasi manusia
|
| 2024-08-13 |
GPT‑4o |
33.2% |
OpenAI merilis SWE-bench Verified dengan subset yang divalidasi manusia
|