| 2026-09-29 |
Qwen3.8-Flash-Next (IQ3_XXS) |
91.41% |
ISTA merilis GGUF GSQ-RCO untuk Qwen3.8-Flash-Next dan build Coder yang memangkas 50% ahli
|
| 2026-09-25 |
VeriLoop E2 |
93.94% |
VeriLoop E2: Model pasca-pelatihan 27B dengan tangga GGUF dari BF16 ke IQ1_M
|
| 2026-09-11 |
GPT-6 Astra |
96.3% |
OpenAI meluncurkan GPT-6 Astra, menduduki puncak papan peringkat dengan biaya lebih rendah
|
| 2026-09-10 |
DeepSeek-V4.1-Flash |
90.9% |
DeepSeek merilis model V4.1-Flash dengan dukungan multimodal asli
|
| 2026-09-07 |
K2-Horizon-375B-A23B |
87.3% |
IFM merilis K2 Horizon: enam model Apache 2.0 dari 0,9B hingga 375B
|
| 2026-08-28 |
GLM-5.3 |
91.72% |
Z.ai melakukan fine-tuning GLM-5.3 untuk peningkatan keamanan siber
|
| 2026-08-25 |
QAH model (GPT-OSS 120B compressed to 60B, MXFP4) |
67.4% |
QAH dari Multiverse Computing membuat GPT-OSS 4-bit melampaui versi aslinya presisi penuh
|
| 2026-08-21 |
Grok 4.6 |
94.9% |
SpaceXAI memperkenalkan Grok 4.6 dengan data Cursor untuk pekerjaan agentic
|
| 2026-08-03 |
Qwen3.8-Max |
92.6% |
Alibaba merilis Qwen3.8-Max, model MoE dengan 2,4 triliun parameter
|
| 2026-08-03 |
Inkling-Small |
89.5% |
Thinking Machines Lab merilis Inkling-Small, model MoE multimodal dengan bobot terbuka 276B
|
| 2026-07-17 |
Kimi K3 |
93.5% |
Moonshot AI merilis Kimi K3 terbuka, model MoE 2,8T parameter dengan konteks 1M
|
| 2026-07-17 |
GPT-Live-1 |
84.2% |
OpenAI merilis model suara full-duplex dan pengadilan Jerman menjatuhkan tanggung jawab kepada Google untuk Ringkasan AI
|
| 2026-03-25 |
o3 |
87.7% |
OpenAI mengumumkan pensiunnya o3 dari ChatGPT dan membagikan skor benchmark
|
| 2026-02-25 |
Grok 4 |
87.7% |
xAI merilis model penalaran Grok 4 dengan benchmark agentic dan coding yang kuat
|
| 2026-02-05 |
Claude Opus 4.6 |
91.3% |
Anthropic merilis Claude Opus 4.6 dengan jendela konteks 1M dan peningkatan agentic
|
| 2026-01-27 |
Kimi K2.5 |
87.6% |
Moonshot merilis Kimi K2.5 dengan teknologi Agent Swarm
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI merilis model GPT-5.2 Pro dan Thinking untuk sains dan matematika
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI memperkenalkan GPT-5.2 dengan kemampuan coding, konteks panjang, dan penalaran yang ditingkatkan
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI memperkenalkan GPT-5.2 dengan kemampuan coding, konteks panjang, dan penalaran yang ditingkatkan
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI merilis model GPT-5.2 Pro dan Thinking untuk sains dan matematika
|
| 2025-12-04 |
Gemini 3 Pro |
93.0% |
Epoch AI meluncurkan Hub Pusat Data Frontier dan menganalisis benchmark OSWorld
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
|
| 2025-10-24 |
Claude 3 Opus |
60.0% |
Benchmark GPQA-Diamond: Skor, Papan Peringkat & Perbandingan Model AI
|
| 2025-10-24 |
O1 |
77.0% |
Benchmark GPQA-Diamond: Skor, Papan Peringkat & Perbandingan Model AI
|
| 2025-10-24 |
Claude Opus 4.6 |
91.3% |
Benchmark GPQA-Diamond: Skor, Papan Peringkat & Perbandingan Model AI
|
| 2025-10-24 |
Gemini 3 Pro |
91.9% |
Benchmark GPQA-Diamond: Skor, Papan Peringkat & Perbandingan Model AI
|
| 2025-10-24 |
GPT-5.2 |
92.4% |
Benchmark GPQA-Diamond: Skor, Papan Peringkat & Perbandingan Model AI
|
| 2025-10-24 |
Gemini 3.1 Pro Preview |
94.1% |
Benchmark GPQA-Diamond: Skor, Papan Peringkat & Perbandingan Model AI
|
| 2025-10-24 |
Aristotle-X1 |
92.4% |
Benchmark GPQA-Diamond: Skor, Papan Peringkat & Perbandingan Model AI
|
| 2025-10-24 |
GPT-4 |
39.0% |
Benchmark GPQA-Diamond: Skor, Papan Peringkat & Perbandingan Model AI
|
| 2025-09-30 |
Claude Sonnet 4.5 |
83.4% |
Anthropic merilis Claude Sonnet 4.5 dengan kemampuan coding dan agen yang ditingkatkan
|
| 2025-09-22 |
DeepSeek-V3.1-Terminus |
74.24% |
DeepSeek merilis DeepSeek-V3.1-Terminus dengan perbaikan bahasa dan agen
|
| 2025-08-07 |
GPT-5 pro |
88.4% |
OpenAI memperkenalkan GPT-5 dengan routing terpadu dan penalaran tingkat ahli
|
| 2025-08-07 |
GPT-5 pro |
89.4% |
OpenAI meluncurkan GPT-5 terpadu dengan penataan rute waktu nyata dan akses gratis
|
| 2025-08-07 |
GPT-5 Pro |
88.4% |
OpenAI meluncurkan GPT-5 dengan penalaran adaptif dan arsitektur terpadu
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Kimi K2: model MoE terbuka dengan 1T parameter dan pengoptimal MuonClip
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Moonshot merilis Kimi K2, model MoE agentic terbuka dengan 32B parameter aktif
|
| 2025-05-30 |
Deepseek-R1-0528 |
81.0% |
DeepSeek memperbarui model R1 dengan penalaran dan skor benchmark yang lebih baik
|
| 2025-05-22 |
Claude Sonnet 4 |
70.0% |
Anthropic memperkenalkan Claude Opus 4 dan Sonnet 4 dengan pemikiran ekstensif dan penggunaan alat
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
Anthropic memperkenalkan Claude Opus 4 dan Sonnet 4 dengan pemikiran ekstensif dan penggunaan alat
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
Anthropic merilis Claude Opus 4 dan Sonnet 4 dengan langkah keamanan ASL-3
|
| 2025-04-16 |
OpenAI o3 |
87.7% |
OpenAI
|
| 2025-04-15 |
Gemini 2.0 Flash |
60.1% |
Google merilis Gemini 2.0 Flash dengan kualitas yang ditingkatkan dan kecepatan dua kali lipat dari Gemini 1.5 Pro
|
| 2025-04-14 |
GPT‑4.1 nano |
50.3% |
OpenAI meluncurkan GPT-4.1, GPT-4.1 mini, dan GPT-4.1 nano di API
|
| 2025-04-10 |
Seed1.5-Thinking |
77.3% |
Seed1.5-Thinking menggunakan pembelajaran penguatan untuk meningkatkan penalaran
|
| 2025-04-05 |
Gemini 2.5 Pro |
84.0% |
Google memperluas akses ke Gemini 2.5 Pro di tengah hasil benchmark yang kuat
|
| 2025-03-26 |
Gemini 2.5 Pro |
84.0% |
Google merilis model penalaran Gemini 2.5 Pro eksperimental dengan konteks 1M token
|
| 2025-03-25 |
Gemini 2.5 Pro (experimental) |
84.0% |
Google DeepMind merilis model eksperimen Gemini 2.5 Pro
|
| 2025-03-25 |
Gemini 2.5 Pro |
84.0% |
Google DeepMind
|
| 2025-03-24 |
DeepSeek-V3-0324 |
68.4% |
DeepSeek-V3-0324 meningkatkan kemampuan penalaran, pemrograman, dan penulisan bahasa Mandarin dibandingkan DeepSeek-V3
|
| 2025-03-11 |
Grok 3 |
84.6% |
xAI merilis Grok 3 dengan penalaran mendalam dan konteks jutaan token
|
| 2025-03-05 |
GPT-4.5 |
71.4% |
OpenAI merilis GPT-4.5, model terbesarnya, untuk ChatGPT Plus
|
| 2025-02-26 |
OpenAI o3-mini |
78.0% |
Perbandingan benchmark Claude 3.7 Sonnet, o3-mini, R1, dan Grok 3 Beta
|
| 2025-02-26 |
Grok 3 Beta |
84.6% |
Perbandingan benchmark Claude 3.7 Sonnet, o3-mini, R1, dan Grok 3 Beta
|
| 2025-02-26 |
DeepSeek R1 |
71.5% |
Perbandingan benchmark Claude 3.7 Sonnet, o3-mini, R1, dan Grok 3 Beta
|
| 2025-02-26 |
Claude 3.5 Sonnet |
65.0% |
Perbandingan benchmark Claude 3.7 Sonnet, o3-mini, R1, dan Grok 3 Beta
|
| 2025-02-26 |
Claude 3.7 Sonnet |
84.8% |
Perbandingan benchmark Claude 3.7 Sonnet, o3-mini, R1, dan Grok 3 Beta
|
| 2025-02-24 |
Claude 3.7 Sonnet |
84.8% |
Anthropic merilis Claude 3.7 Sonnet dengan kontrol penalaran dinamis
|
| 2025-02-19 |
Grok 3 (Think) |
84.6% |
xAI merilis Grok 3 Beta dan agen DeepSearch
|
| 2024-12-20 |
o3 |
87.7% |
OpenAI merilis model o3 dengan kinerja tinggi dalam penalaran dan pemrograman
|
| 2024-11-28 |
QwQ-32B-Preview |
65.2% |
Qwen merilis QwQ-32B-Preview, model penalaran eksperimental
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
Tim Qwen merilis seri Qwen2 dengan model padat dan MoE 72B
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
Laporan Teknis Qwen2 memperkenalkan model padat dan MoE hingga 72B
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
Anthropic merilis tambahan untuk Claude 3.5 Sonnet dengan peningkatan benchmark pemrograman dan visi
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
Anthropic
|
| 2023-11-20 |
GPT-4 based baseline |
39.0% |
GPQA: Benchmark Q&A Tingkat Pascasarjana yang Tahan Google
|