| 2026-09-10 |
DeepSeek-V4.1-Flash |
74.2% |
DeepSeek ने मूल बहुआयामी समर्थन के साथ V4.1-Flash मॉडल जारी किया
|
| 2026-09-04 |
GPT-6 Astra |
74.1% |
OpenAI ने GPT-6 Astra जारी किया, जो 1.05M संदर्भ के साथ एक कंप्यूटर-उपयोग मॉडल है
|
| 2026-09-04 |
Muse Spark 1.3 |
75.4% |
Meta ने Muse Spark 1.3 जारी किया है जिसमें कम टूल कॉल और टोकन हैं
|
| 2026-08-26 |
GLM-5.3-Flash |
63.0% |
Ox Alpha, GLM-5.3-Flash है
|
| 2026-08-22 |
GLM-5.3 |
69.0% |
GLM-5.3 DeepSWE पर Claude Fable 5 की सटीकता को पांचवें खर्च पर बराबर लाता है
|
| 2026-08-22 |
Claude Fable 5 |
69.7% |
GLM-5.3 DeepSWE पर Claude Fable 5 की सटीकता को पांचवें खर्च पर बराबर लाता है
|
| 2026-08-21 |
DeepSeek-V4-Flash-Vision-Exp |
59.3% |
DeepSeek ने DeepSeek-V4-Flash-Vision-Exp मल्टीमोडल मॉडल जारी किया
|
| 2026-08-20 |
Ornith-1.5 |
56.0% |
Z.ai ने पोस्ट-ट्रेनिंग स्केलिंग नियम का प्रस्ताव रखा और GLM 5.3 जारी किया; Ornith-1.5 स्व-सुधार के साथ लॉन्च हुआ
|
| 2026-08-19 |
Ornith-1.5 |
56.0% |
Ornith-1.5 ने स्वयं-सुधार प्रशिक्षण के साथ 9B, 35B-A3B, और 397B मॉडल जारी किए
|
| 2026-08-18 |
DeepSeek V4 Pro 0813 |
62.8% |
DeepSWE पर DeepSeek V4 Pro 0813 बनाम Claude Fable 5: लागत, कोडिंग और रूटिंग
|
| 2026-08-18 |
Claude Fable 5 |
69.7% |
DeepSWE पर DeepSeek V4 Pro 0813 बनाम Claude Fable 5: लागत, कोडिंग और रूटिंग
|
| 2026-08-18 |
GPT-5.6 Sol |
85.8% |
DeepSeek V4 Pro और GPT-5.6 Sol का cascade 83% DeepSWE कार्यों को $3.35 में हल करता है
|
| 2026-08-18 |
DeepSeek V4 Pro 0813 |
88.5% |
DeepSeek V4 Pro और GPT-5.6 Sol का cascade 83% DeepSWE कार्यों को $3.35 में हल करता है
|
| 2026-08-17 |
GLM-5.3 |
66.9% |
Z.ai ने GLM-5.3 कोडिंग मॉडल लॉन्च किया; Cursor SpaceXAI में शामिल हुआ
|
| 2026-08-13 |
Gemini 3.7 Flash |
65.3% |
Google ने बेहतर कोडिंग और कम लागत के साथ Gemini 3.7 Flash पेश किया
|
| 2026-08-13 |
DeepSeek-V4-Pro |
62.7% |
DeepSeek-V4-Pro GA रिलीज ने एजेंट क्षमताओं को बढ़ाया और Responses API समर्थन जोड़ा
|
| 2026-08-13 |
Grok 4.6 |
65.9% |
SpaceXAI ने 500K संदर्भ और बेहतर एजेंटिक तर्क के साथ Grok 4.6 जारी किया
|
| 2026-08-07 |
DeepSeek-V4 Flash 0731 |
53.3% |
DeepSeek-V4 Flash 0731 बनाम GPT-5.6 Luna: DeepSWE पर लागत और कोडिंग
|
| 2026-08-07 |
GPT-5.6 Luna |
67.2% |
DeepSeek-V4 Flash 0731 बनाम GPT-5.6 Luna: DeepSWE पर लागत और कोडिंग
|
| 2026-08-03 |
Qwen3.8-Max |
56.6% |
अलibaba ने 2.4T-पैरामीटर MoE मॉडल Qwen3.8-Max जारी किया
|
| 2026-07-31 |
DeepSeek-V4-Flash-0731 |
54.4% |
DeepSeek ने कम लागत में प्रमुख एजेंटिक सुधारों के साथ V4-Flash-0731 जारी किया
|
| 2026-07-31 |
DeepSeek-V4-Flash |
54.4% |
DeepSeek ने एजेंट क्षमताओं में वृद्धि के साथ DeepSeek-V4-Flash को सार्वजनिक बीटा में जारी किया
|
| 2026-07-27 |
Gemini 3.6 Flash |
49.0% |
गूगल ने गेमिनी 3.6 फ्लैश, 3.5 फ्लैश-लाइट और 3.5 फ्लैश साइबर जारी किए
|
| 2026-07-27 |
Kimi K3 |
68.5% |
Kimi K3 ने DeepSWE pass@4 पर GPT-5.6 Sol को हराया और लागत 64% कम की
|
| 2026-07-27 |
GPT-5.6 Sol |
72.7% |
Kimi K3 ने DeepSWE pass@4 पर GPT-5.6 Sol को हराया और लागत 64% कम की
|