| 2026-09-10 |
DeepSeek-V4.1-Flash |
90.6% |
DeepSeek merilis model V4.1-Flash dengan dukungan multimodal asli
|
| 2026-09-07 |
K2-Horizon-MoVA-36B-A4B |
58.6% |
IFM merilis K2 Horizon: enam model Apache 2.0 dari 0,9B hingga 375B
|
| 2026-09-07 |
K2-Horizon-375B-A23B |
66.9% |
IFM merilis K2 Horizon: enam model Apache 2.0 dari 0,9B hingga 375B
|
| 2026-09-04 |
Muse Spark 1.3 |
88.8% |
Meta merilis Muse Spark 1.3 dengan lebih sedikit panggilan alat dan token
|
| 2026-08-26 |
Granite 4.2 30B |
29.24% |
IBM merilis Granite 4.2 dengan penalaran asli dan RL agens untuk model perusahaan terbuka
|
| 2026-08-26 |
Granite 4.2 8B |
20.56% |
IBM merilis Granite 4.2 dengan penalaran asli dan RL agens untuk model perusahaan terbuka
|
| 2026-08-21 |
Grok 4.6 |
88.4% |
SpaceXAI memperkenalkan Grok 4.6 dengan data Cursor untuk pekerjaan agentic
|
| 2026-08-21 |
DeepSeek-V4-Flash-Vision-Exp |
83.9% |
DeepSeek merilis model multimodal DeepSeek-V4-Flash-Vision-Exp
|
| 2026-08-20 |
agents |
94.0% |
Meta merilis Muse Video dengan audio asli; Stripe mengakuisisi OpenRouter
|
| 2026-08-19 |
Ornith-1.5 |
86.1% |
Ornith-1.5 merilis model 9B, 35B-A3B, dan 397B dengan pelatihan peningkatan mandiri
|
| 2026-08-13 |
DeepSeek-V4-Pro |
87.9% |
Rilis GA DeepSeek-V4-Pro meningkatkan kemampuan agen dan menambahkan dukungan API Respons
|
| 2026-08-13 |
Grok 4.6 |
88.4% |
xAI merilis Grok 4.6; Alibaba membuka Qwen3.8-MoE; DeepSeek V4 Pro GA
|
| 2026-08-11 |
Opus 5 |
86.74% |
Agen Ouroboros yang berkembang sendiri menetapkan tolok ukur baru dengan Opus 5
|
| 2026-08-10 |
Qwen3.6-27B |
60.7% |
Meta merilis Muse Glimmer, model agen berbobot terbuka 30B yang berjalan pada satu GPU konsumen
|
| 2026-08-09 |
DeepSeek V4 Flash 0731 |
82.7% |
DeepSeek V4 Flash 0731 mencapai 82.7% di Terminal-Bench 2.1 dengan harness publik
|
| 2026-08-08 |
Pokee-Isaac 28B |
65.1% |
Pokee AI merilis Pokee-Isaac 28B, model konteks 10M-token untuk deployment dalam batas yang ditentukan
|
| 2026-08-07 |
DeepSeek-V4-Flash-0731 |
82.7% |
DeepSeek merilis V4-Flash-0731, melampaui V4-Pro dengan biaya lebih rendah
|
| 2026-08-05 |
Muse Spark 1.1 |
80.0% |
Meta merilis agen terminal beta Muse Code yang didukung oleh Muse Spark 1.2
|
| 2026-08-05 |
Qwen3.8-Max |
67.4% |
Alibaba mengumumkan Qwen3.8-Max dengan 2.4T parameter dan bobot terbuka yang akan datang
|
| 2026-08-03 |
Qwen3.8-Max |
86.6% |
Alibaba merilis Qwen3.8-Max, model MoE dengan 2,4 triliun parameter
|
| 2026-08-03 |
Inkling-Small |
64.7% |
Thinking Machines Lab merilis Inkling-Small, model MoE multimodal dengan bobot terbuka 276B
|
| 2026-08-01 |
V4 Flash 0731 |
79.0% |
DeepSeek merilis V4-Flash dengan peningkatan besar pasca-pelatihan dan bobot terbuka
|
| 2026-08-01 |
DeepSeek-V4-Flash |
79.0% |
DeepSeek merilis V4-Flash dengan peningkatan pasca-pelatihan dan bobot terbuka
|
| 2026-07-31 |
DeepSeek-V4-Flash-0731 |
82.7% |
DeepSeek merilis V4-Flash-0731 dengan peningkatan agentic signifikan dan biaya lebih rendah
|
| 2026-07-31 |
DeepSeek-V4-Flash |
82.7% |
DeepSeek merilis DeepSeek-V4-Flash dalam beta publik dengan kemampuan agen yang ditingkatkan
|
| 2026-07-27 |
Gemini 3.5 Flash-Lite |
54.0% |
Google merilis Gemini 3.6 Flash, 3.5 Flash-Lite, dan 3.5 Flash Cyber
|
| 2026-07-26 |
KAT-Coder-V2.5 |
60.7% |
KwaiKAT merilis KAT-Coder-V2.5, model koding agentic yang dilatih pada lebih dari 100.000 lingkungan yang dapat diverifikasi
|
| 2026-07-21 |
Gemini 3.5 Flash-Lite |
54.0% |
Google merilis Gemini 3.6 Flash, 3.5 Flash-Lite, dan 3.5 Flash Cyber untuk beban kerja agentic
|
| 2026-07-21 |
Gemini 3.5 Flash-Lite |
54.0% |
Google merilis Gemini 3.6 Flash, 3.5 Flash-Lite, dan 3.5 Flash Cyber
|
| 2026-07-08 |
hermes |
55.0% |
Pengguna membandingkan Mimo v2.5 dengan DeepSeek V4 Flash dan Hermes
|
| 2026-07-08 |
Grok 4.5 |
83.3% |
xAI merilis Grok 4.5 dengan biaya rendah dan kinerja benchmark campuran
|
| 2026-07-07 |
LLM-as-a-Verifier |
86.5% |
LLM-as-a-Verifier memperkenalkan kerangka verifikasi serbaguna dengan skor kontinu
|
| 2026-07-05 |
GLM 5.2 FP8 with FP8 KV |
79.8% |
GLM 5.2 FP8 dengan KV FP8 mencapai 79,8% pada Terminal-Bench 2.1
|
| 2026-04-25 |
Qwen3.6-27B |
59.3% |
Alibaba merilis Qwen3.6-27B, mengungguli pendahulu yang lebih besar dalam benchmark pemrograman
|
| 2026-04-25 |
GPT-5.5 |
82.7% |
OpenAI merilis GPT-5.5, model yang dilatih ulang dari awal dengan pemrosesan omnimodal asli
|
| 2026-04-23 |
GPT-5.5 |
82.7% |
OpenAI merilis GPT-5.5 dengan kemampuan agentic dan penggandaan harga API
|
| 2026-04-23 |
GPT-5.5 |
82.7% |
OpenAI merilis GPT-5.5 dan GPT-5.5 Pro melalui API
|
| 2026-04-12 |
MiniMax M2.7 |
57.0% |
MiniMax membuka sumber M2.7, model MoE yang berevolusi sendiri dengan skor 56,22% di SWE-Pro
|
| 2026-02-10 |
Step 3.5 Flash |
51.0% |
Langkah 3.5 Flash: model MoE aktif 11B mencapai kinerja agentic tingkat terdepan
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
58.1% |
OpenAI menjadikan GPT-5.1-Codex-Max sebagai default di Codex CLI
|