| 2026-09-10 |
DeepSeek-V4.1-Flash |
74.2% |
DeepSeek merilis model V4.1-Flash dengan dukungan multimodal asli
|
| 2026-09-04 |
GPT-6 Astra |
74.1% |
OpenAI merilis GPT-6 Astra, model penggunaan komputer dengan konteks 1,05 juta
|
| 2026-09-04 |
Muse Spark 1.3 |
75.4% |
Meta merilis Muse Spark 1.3 dengan lebih sedikit panggilan alat dan token
|
| 2026-08-26 |
GLM-5.3-Flash |
63.0% |
Ox Alpha adalah GLM-5.3-Flash
|
| 2026-08-22 |
GLM-5.3 |
69.0% |
GLM-5.3 menyamai akurasi Claude Fable 5 pada DeepSWE dengan biaya seperlima
|
| 2026-08-22 |
Claude Fable 5 |
69.7% |
GLM-5.3 menyamai akurasi Claude Fable 5 pada DeepSWE dengan biaya seperlima
|
| 2026-08-21 |
DeepSeek-V4-Flash-Vision-Exp |
59.3% |
DeepSeek merilis model multimodal DeepSeek-V4-Flash-Vision-Exp
|
| 2026-08-20 |
Ornith-1.5 |
56.0% |
Z.ai mengusulkan hukum penskalaan pasca-pelatihan dan merilis GLM 5.3; Ornith-1.5 diluncurkan dengan peningkatan diri
|
| 2026-08-19 |
Ornith-1.5 |
56.0% |
Ornith-1.5 merilis model 9B, 35B-A3B, dan 397B dengan pelatihan peningkatan mandiri
|
| 2026-08-18 |
DeepSeek V4 Pro 0813 |
62.8% |
DeepSeek V4 Pro 0813 vs Claude Fable 5 pada DeepSWE: Biaya, Pemrograman, dan Pengalihan
|
| 2026-08-18 |
Claude Fable 5 |
69.7% |
DeepSeek V4 Pro 0813 vs Claude Fable 5 pada DeepSWE: Biaya, Pemrograman, dan Pengalihan
|
| 2026-08-18 |
GPT-5.6 Sol |
85.8% |
DeepSeek V4 Pro dan GPT-5.6 Sol menyelesaikan 83% tugas DeepSWE dengan biaya $3,35
|
| 2026-08-18 |
DeepSeek V4 Pro 0813 |
88.5% |
DeepSeek V4 Pro dan GPT-5.6 Sol menyelesaikan 83% tugas DeepSWE dengan biaya $3,35
|
| 2026-08-17 |
GLM-5.3 |
66.9% |
Z.ai meluncurkan model coding GLM-5.3; Cursor bergabung dengan SpaceXAI
|
| 2026-08-13 |
Gemini 3.7 Flash |
65.3% |
Google memperkenalkan Gemini 3.7 Flash dengan kemampuan coding yang lebih baik dan biaya lebih rendah
|
| 2026-08-13 |
DeepSeek-V4-Pro |
62.7% |
Rilis GA DeepSeek-V4-Pro meningkatkan kemampuan agen dan menambahkan dukungan API Respons
|
| 2026-08-13 |
Grok 4.6 |
65.9% |
SpaceXAI merilis Grok 4.6 dengan konteks 500K dan penalaran agentic yang lebih baik
|
| 2026-08-07 |
DeepSeek-V4 Flash 0731 |
53.3% |
DeepSeek-V4 Flash 0731 vs GPT-5.6 Luna pada DeepSWE: Biaya dan Pemrograman
|
| 2026-08-07 |
GPT-5.6 Luna |
67.2% |
DeepSeek-V4 Flash 0731 vs GPT-5.6 Luna pada DeepSWE: Biaya dan Pemrograman
|
| 2026-08-03 |
Qwen3.8-Max |
56.6% |
Alibaba merilis Qwen3.8-Max, model MoE dengan 2,4 triliun parameter
|
| 2026-07-31 |
DeepSeek-V4-Flash-0731 |
54.4% |
DeepSeek merilis V4-Flash-0731 dengan peningkatan agentic signifikan dan biaya lebih rendah
|
| 2026-07-31 |
DeepSeek-V4-Flash |
54.4% |
DeepSeek merilis DeepSeek-V4-Flash dalam beta publik dengan kemampuan agen yang ditingkatkan
|
| 2026-07-27 |
Gemini 3.6 Flash |
49.0% |
Google merilis Gemini 3.6 Flash, 3.5 Flash-Lite, dan 3.5 Flash Cyber
|
| 2026-07-27 |
Kimi K3 |
68.5% |
Kimi K3 mengalahkan GPT-5.6 Sol di DeepSWE pass@4 dan biaya lebih murah 64%
|
| 2026-07-27 |
GPT-5.6 Sol |
72.7% |
Kimi K3 mengalahkan GPT-5.6 Sol di DeepSWE pass@4 dan biaya lebih murah 64%
|