| 2026-09-29 |
Qwen3.8-Flash-Next (IQ3_XXS) |
91.41% |
ISTA ने Qwen3.8-Flash-Next और 50% विशेषज्ञ-कटाई वाले कोडर बिल्ड के लिए GSQ-RCO GGUF जारी किए
|
| 2026-09-25 |
VeriLoop E2 |
93.94% |
VeriLoop E2: BF16 से IQ1_M तक GGUF सीढ़ी के साथ 27B पोस्ट-ट्रेन्ड मॉडल
|
| 2026-09-11 |
GPT-6 Astra |
96.3% |
OpenAI ने GPT-6 Astra लॉन्च किया, कम लागत के साथ लीडरबोर्ड में शीर्ष स्थान हासिल किया
|
| 2026-09-10 |
DeepSeek-V4.1-Flash |
90.9% |
DeepSeek ने मूल बहुआयामी समर्थन के साथ V4.1-Flash मॉडल जारी किया
|
| 2026-09-07 |
K2-Horizon-375B-A23B |
87.3% |
IFM ने K2 Horizon जारी किया: 0.9B से 375B तक के छह Apache 2.0 मॉडल
|
| 2026-08-28 |
GLM-5.3 |
91.72% |
साइबर सुरक्षा लाभों के लिए Z.ai ने GLM-5.3 को फाइन-ट्यून किया
|
| 2026-08-25 |
QAH model (GPT-OSS 120B compressed to 60B, MXFP4) |
67.4% |
मल्टीवर्स कंप्यूटिंग का QAH 4-बिट GPT-OSS को इसके पूर्ण-प्रीसिजन मूल से बेहतर प्रदर्शन करने में सक्षम बनाता है
|
| 2026-08-21 |
Grok 4.6 |
94.9% |
SpaceXAI ने एजेंटिक कार्य के लिए Cursor डेटा के साथ Grok 4.6 पेश किया
|
| 2026-08-03 |
Qwen3.8-Max |
92.6% |
अलibaba ने 2.4T-पैरामीटर MoE मॉडल Qwen3.8-Max जारी किया
|
| 2026-08-03 |
Inkling-Small |
89.5% |
थिंकिंग मशीन्स लैब ने 276B ओपन वेट्स मल्टीमोडल MoE मॉडल इंकलिंग-स्माल रिलीज़ किया
|
| 2026-07-17 |
Kimi K3 |
93.5% |
Moonshot AI ने 1M संदर्भ के साथ 2.8T-पैरामीटर MoE मॉडल Kimi K3 को ओपन किया
|
| 2026-07-17 |
GPT-Live-1 |
84.2% |
OpenAI ने फुल-डप्लेक्स वॉइस मॉडल्स जारी किए और जर्मन अदालत ने Google को AI ओवरव्यू के लिए जिम्मेदार ठहराया
|
| 2026-03-25 |
o3 |
87.7% |
OpenAI ने ChatGPT से o3 को निष्क्रिय करने की घोषणा की और बेंचमार्क स्कोर साझा किए
|
| 2026-02-25 |
Grok 4 |
87.7% |
xAI ने मजबूत एजेंटिक और कोडिंग बेंचमार्क्स के साथ Grok 4 तर्क मॉडल जारी किया
|
| 2026-02-05 |
Claude Opus 4.6 |
91.3% |
Anthropic ने Claude Opus 4.6 जारी की, जिसमें 1M संदर्भ खिड़की और एजेंटिक सुधार शामिल हैं
|
| 2026-01-27 |
Kimi K2.5 |
87.6% |
Moonshot ने Agent Swarm तकनीक के साथ Kimi K2.5 जारी किया
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI ने विज्ञान और गणित के लिए GPT-5.2 Pro और Thinking मॉडल जारी किए
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI ने कोडिंग, लंबे-संदर्भ और तर्क क्षमताओं में सुधार के साथ GPT-5.2 पेश किया
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI ने कोडिंग, लंबे-संदर्भ और तर्क क्षमताओं में सुधार के साथ GPT-5.2 पेश किया
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI ने विज्ञान और गणित के लिए GPT-5.2 Pro और Thinking मॉडल जारी किए
|
| 2025-12-04 |
Gemini 3 Pro |
93.0% |
Epoch AI ने Frontier Data Centers Hub लॉन्च किया और OSWorld benchmark का विश्लेषण किया
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
Google ने शीर्ष तर्क और बहुआयामी क्षमताओं के साथ Gemini 3 Pro जारी किया
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
Google ने शीर्ष तर्क और बहुआयामी क्षमताओं के साथ Gemini 3 Pro जारी किया
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
Google ने Gemini 3 Pro को अत्याधुनिक तर्क और बहु-मोडल क्षमताओं के साथ जारी किया
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
Google ने Gemini 3 Pro को अत्याधुनिक तर्क और बहु-मोडल क्षमताओं के साथ जारी किया
|
| 2025-10-24 |
Claude 3 Opus |
60.0% |
GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
|
| 2025-10-24 |
O1 |
77.0% |
GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
|
| 2025-10-24 |
Claude Opus 4.6 |
91.3% |
GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
|
| 2025-10-24 |
Gemini 3 Pro |
91.9% |
GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
|
| 2025-10-24 |
GPT-5.2 |
92.4% |
GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
|
| 2025-10-24 |
Gemini 3.1 Pro Preview |
94.1% |
GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
|
| 2025-10-24 |
Aristotle-X1 |
92.4% |
GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
|
| 2025-10-24 |
GPT-4 |
39.0% |
GPQA-Diamond बेंचमार्क: स्कोर, लीडरबोर्ड और एआई मॉडल्स की तुलना
|
| 2025-09-30 |
Claude Sonnet 4.5 |
83.4% |
Anthropic ने कोडिंग और एजेंट क्षमताओं में सुधार के साथ Claude Sonnet 4.5 जारी किया
|
| 2025-09-22 |
DeepSeek-V3.1-Terminus |
74.24% |
DeepSeek ने DeepSeek-V3.1-Terminus को भाषा और एजेंट सुधारों के साथ जारी किया
|
| 2025-08-07 |
GPT-5 pro |
88.4% |
OpenAI ने एकत्रीकृत रूटिंग और विशेषज्ञ-स्तरीय तर्क के साथ GPT-5 पेश किया
|
| 2025-08-07 |
GPT-5 pro |
89.4% |
OpenAI ने रियल-टाइम राउटिंग और मुफ्त एक्सेस के साथ एकत्रीकृत GPT-5 लॉन्च किया
|
| 2025-08-07 |
GPT-5 Pro |
88.4% |
ओपनएआई ने अनुकूलित तर्कशक्ति और एकीकृत वास्तुकला के साथ GPT-5 लॉन्च किया
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Kimi K2: 1T पैरामीटर और MuonClip ऑप्टिमाइज़र के साथ ओपन MoE मॉडल
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Moonshot ने Kimi K2 जारी किया, जो 32B सक्रिय पैरामीटर के साथ एक ओपन एजेंटिक MoE मॉडल है
|
| 2025-05-30 |
Deepseek-R1-0528 |
81.0% |
DeepSeek ने R1 मॉडल को बेहतर तर्कशक्ति और बेंचमार्क स्कोर के साथ अपडेट किया
|
| 2025-05-22 |
Claude Sonnet 4 |
70.0% |
एन्थ्रोपिक ने क्लॉड ओपस 4 और सनेट 4 को विस्तृत चिंतन और टूल उपयोग के साथ पेश किया
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
एन्थ्रोपिक ने क्लॉड ओपस 4 और सनेट 4 को विस्तृत चिंतन और टूल उपयोग के साथ पेश किया
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
Anthropic ने Claude Opus 4 और Sonnet 4 को ASL-3 सुरक्षा उपायों के साथ जारी किया
|
| 2025-04-16 |
OpenAI o3 |
87.7% |
OpenAI
|
| 2025-04-15 |
Gemini 2.0 Flash |
60.1% |
गूगल ने गेमिनी 1.5 प्रो की तुलना में दोगुनी गति और बढ़े हुए गुणवत्ता के साथ गेमिनी 2.0 फ्लैश जारी किया
|
| 2025-04-14 |
GPT‑4.1 nano |
50.3% |
OpenAI ने API में GPT-4.1, GPT-4.1 mini और GPT-4.1 nano लॉन्च किए
|
| 2025-04-10 |
Seed1.5-Thinking |
77.3% |
Seed1.5-Thinking तर्क को बेहतर बनाने के लिए रीइन्फोर्समेंट लर्निंग का उपयोग करता है
|
| 2025-04-05 |
Gemini 2.5 Pro |
84.0% |
मजबूत बेंचमार्क परिणामों के बीच गूगल ने जेमिनी 2.5 प्रो तक पहुंच का विस्तार किया
|
| 2025-03-26 |
Gemini 2.5 Pro |
84.0% |
गूगल ने 1M टोकन संदर्भ के साथ एक्सपेरिमेंटल जेमिनी 2.5 प्रो रीजनिंग मॉडल जारी किया
|
| 2025-03-25 |
Gemini 2.5 Pro (experimental) |
84.0% |
Google DeepMind ने Gemini 2.5 Pro एक्सपेरिमेंटल मॉडल जारी किया
|
| 2025-03-25 |
Gemini 2.5 Pro |
84.0% |
Google DeepMind
|
| 2025-03-24 |
DeepSeek-V3-0324 |
68.4% |
DeepSeek-V3-0324 ने DeepSeek-V3 की तुलना में तर्कशक्ति, कोडिंग और चीनी लेखन में सुधार किया है
|
| 2025-03-11 |
Grok 3 |
84.6% |
xAI ने गहरा तर्क और मिलियन-टोकन संदर्भ के साथ Grok 3 जारी किया
|
| 2025-03-05 |
GPT-4.5 |
71.4% |
OpenAI ने ChatGPT Plus के लिए अपना सबसे बड़ा मॉडल GPT-4.5 जारी किया
|
| 2025-02-26 |
OpenAI o3-mini |
78.0% |
क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
|
| 2025-02-26 |
Grok 3 Beta |
84.6% |
क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
|
| 2025-02-26 |
DeepSeek R1 |
71.5% |
क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
|
| 2025-02-26 |
Claude 3.5 Sonnet |
65.0% |
क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
|
| 2025-02-26 |
Claude 3.7 Sonnet |
84.8% |
क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
|
| 2025-02-24 |
Claude 3.7 Sonnet |
84.8% |
Anthropic ने Claude 3.7 Sonnet को गतिशील तर्क नियंत्रण के साथ जारी किया
|
| 2025-02-19 |
Grok 3 (Think) |
84.6% |
xAI ने Grok 3 बीटा और DeepSearch एजेंट जारी किया
|
| 2024-12-20 |
o3 |
87.7% |
OpenAI ने तर्क और कोडिंग में उच्च प्रदर्शन के साथ o3 मॉडल जारी किया
|
| 2024-11-28 |
QwQ-32B-Preview |
65.2% |
Qwen ने QwQ-32B-Preview जारी किया, एक प्रायोगिक तर्कशील मॉडल
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
Qwen टीम ने 72B डेंस और MoE मॉडल के साथ Qwen2 सीरीज जारी की
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
Qwen2 तकनीकी रिपोर्ट में 72B तक घन और MoE मॉडल पेश किए गए
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
एन्थ्रोपिक ने क्लॉड 3.5 सॉनेट के लिए कोडिंग और विज़न बेंचमार्क में सुधार के साथ एक एडेन्डम जारी किया
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
Anthropic
|
| 2023-11-20 |
GPT-4 based baseline |
39.0% |
GPQA: एक ग्रेजुएट-स्तर का Google-प्रूफ Q&A बेंचमार्क
|