| 2026-09-29 |
Gemini 3.5 Flash |
79.0% |
AI एजेंट हार्नेस ओवरफिटिंग को रोकने के लिए Google Research ने RRSI जारी किया
|
| 2026-09-29 |
Qwen3.8-Flash-Next Coder |
75.6% |
ISTA ने Qwen3.8-Flash-Next और 50% विशेषज्ञ-कटाई वाले कोडर बिल्ड के लिए GSQ-RCO GGUF जारी किए
|
| 2026-09-29 |
Qwen3.5-4B (with ROFT) |
49.2% |
ROFT स्व-उत्पन्न व्याख्याओं पर फाइन-ट्यून करके एजेंटिक मॉडलों को बेहतर बनाता है
|
| 2026-09-28 |
Ember-1 |
92.2% |
Fireworks AI ने Ember-1 जारी किया, जो 40% कम टोकन का उपयोग करने वाला Kimi K3 पर पोस्ट-ट्रेनिंग किया गया मॉडल है
|
| 2026-09-09 |
Qwen Test agent + Repair agent (post-trained) |
72.6% |
ExecCritic भूमिका-विशिष्ट RL का उपयोग कर टेस्ट-मार्गदर्न मरम्मत द्वारा कोडिंग एजेंट्स में सुधार करता है
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCritic भूमिका-विशिष्ट RL का उपयोग कर टेस्ट-मार्गदर्न मरम्मत द्वारा कोडिंग एजेंट्स में सुधार करता है
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCritic भूमिका-विशिष्ट RL का उपयोग कर टेस्ट-मार्गदर्न मरम्मत द्वारा कोडिंग एजेंट्स में सुधार करता है
|
| 2026-09-09 |
base Test agent (no-test baseline) |
57.3% |
ExecCritic भूमिका-विशिष्ट RL का उपयोग कर टेस्ट-मार्गदर्न मरम्मत द्वारा कोडिंग एजेंट्स में सुधार करता है
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCritic भूमिका-विशिष्ट RL का उपयोग कर टेस्ट-मार्गदर्न मरम्मत द्वारा कोडिंग एजेंट्स में सुधार करता है
|
| 2026-09-09 |
Qwen Test agent (post-trained) + Repair agent (post-trained) |
72.6% |
ExecCritic भूमिका-विशिष्ट RL का उपयोग करके परीक्षण-निर्देशित मरम्मत के माध्यम से कोडिंग एजेंट्स में सुधार करता है
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCritic भूमिका-विशिष्ट RL का उपयोग करके परीक्षण-निर्देशित मरम्मत के माध्यम से कोडिंग एजेंट्स में सुधार करता है
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCritic भूमिका-विशिष्ट RL का उपयोग करके परीक्षण-निर्देशित मरम्मत के माध्यम से कोडिंग एजेंट्स में सुधार करता है
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCritic भूमिका-विशिष्ट RL का उपयोग करके परीक्षण-निर्देशित मरम्मत के माध्यम से कोडिंग एजेंट्स में सुधार करता है
|
| 2026-09-09 |
base Test agent |
57.3% |
ExecCritic भूमिका-विशिष्ट RL का उपयोग करके परीक्षण-निर्देशित मरम्मत के माध्यम से कोडिंग एजेंट्स में सुधार करता है
|
| 2026-09-07 |
K2-Horizon-7B |
70.6% |
IFM ने K2 Horizon जारी किया: 0.9B से 375B तक के छह Apache 2.0 मॉडल
|
| 2026-09-07 |
K2-Horizon-3.7B |
68.6% |
IFM ने K2 Horizon जारी किया: 0.9B से 375B तक के छह Apache 2.0 मॉडल
|
| 2026-09-02 |
Qwen3.5-9B |
16.6% |
CANOPY के साथ Qwen3-14B ने outcome-only RL का उपयोग करके AppWorld में शीर्ष स्थान हासिल किया
|
| 2026-08-26 |
Granite 4.2 30B |
57.0% |
IBM ने खुले उद्योग मॉडलों के लिए स्वदेशी तर्क और एजेंटिक RL के साथ Granite 4.2 जारी किया
|
| 2026-08-26 |
Granite 4.2 8B |
47.67% |
IBM ने खुले उद्योग मॉडलों के लिए स्वदेशी तर्क और एजेंटिक RL के साथ Granite 4.2 जारी किया
|
| 2026-08-20 |
Qwen3.5-9B |
14.6% |
मेटा ने म्यूज़ वीडियो को नेटिव ऑडियो के साथ रिलीज़ किया; स्ट्राइप ने ओपनरूटर को अधिग्रहित किया
|
| 2026-08-20 |
Ornith-1.5 |
86.0% |
Z.ai ने पोस्ट-ट्रेनिंग स्केलिंग नियम का प्रस्ताव रखा और GLM 5.3 जारी किया; Ornith-1.5 स्व-सुधार के साथ लॉन्च हुआ
|
| 2026-08-19 |
Ornith-1.5 |
86.0% |
Ornith-1.5 ने स्वयं-सुधार प्रशिक्षण के साथ 9B, 35B-A3B, और 397B मॉडल जारी किए
|
| 2026-08-18 |
Qwen3.5-27B |
74.8% |
Kozuchi Agent ने Qwen3.5-27B का उपयोग करके 374 SWE-bench Verified उदाहरणों को हल किया
|
| 2026-08-10 |
Qwen3.6-27B |
77.2% |
मेटा ने म्यूज़ ग्लिमर जारी किया, एक 30B ओपन-वेइट्स एजेंटिक मॉडल जो एक उपभोक्ता GPU पर चलता है
|
| 2026-08-03 |
Orchard-SWE |
69.7% |
माइक्रोसॉफ्ट रिसर्च ने स्केलेबल एजेंटिक एआई के लिए ऑर्किड फ्रेमवर्क जारी किया
|
| 2026-08-03 |
Inkling-Small |
80.2% |
थिंकिंग मशीन्स लैब ने 276B ओपन वेट्स मल्टीमोडल MoE मॉडल इंकलिंग-स्माल रिलीज़ किया
|
| 2026-07-24 |
Claude Opus 5 |
96.0% |
Anthropic ने क्लॉड ओपस 5 को डिफ़ॉल्ट थिंकिंग और एजेंटिक कोडिंग लाभों के साथ जारी किया
|
| 2026-07-19 |
DeepSeek V4 Pro |
80.6% |
बेंचमार्क, लाइसेंस और सर्विंग लागत पर Kimi K3, DeepSeek V4 Pro और GLM-5.2 की तुलना
|
| 2026-07-17 |
Devstral 2 |
72.2% |
कोड के लिए Mistral Vibe स्केफोल्ड-से-PR कार्य में चार कोडिंग एजेंट्स पर प्रथम स्थान हासिल करता है
|
| 2026-07-17 |
Devstral Small 2 |
68.0% |
कोड के लिए Mistral Vibe स्केफोल्ड-से-PR कार्य में चार कोडिंग एजेंट्स पर प्रथम स्थान हासिल करता है
|
| 2026-07-14 |
Qwen3.5-35B-A3B |
6.0% |
UMoE सुधारित डोमेन-विशिष्ट फाइन-ट्यूनिंग के लिए MoE विशेषज्ञ पूल को पुनः संरेखित करता है
|
| 2026-07-14 |
Qwen3-30B-A3B |
6.0% |
UMoE सुधारित डोमेन-विशिष्ट फाइन-ट्यूनिंग के लिए MoE विशेषज्ञ पूल को पुनः संरेखित करता है
|
| 2026-07-07 |
LLM-as-a-Verifier |
78.2% |
LLM-as-a-Verifier ने निरंतर स्कोरिंग के साथ सामान्य उद्देश्य सत्यापन ढांचा पेश किया
|
| 2026-04-25 |
Qwen3.6-27B |
77.2% |
अलिबाबा ने Qwen3.6-27B जारी किया, कोडिंग बेंचमार्क्स पर बड़े पूर्ववर्ती को हराया
|
| 2026-04-24 |
V4-Pro-Max |
80.6% |
एजेंट्स के लिए कुशल लॉन्ग-कॉन्टेक्स्ट आर्किटेक्चर के साथ DeepSeek ने V4 जारी किया
|
| 2026-03-25 |
o3 |
71.7% |
OpenAI ने ChatGPT से o3 को निष्क्रिय करने की घोषणा की और बेंचमार्क स्कोर साझा किए
|
| 2026-02-17 |
Claude Sonnet 4.6 |
79.6% |
Anthropic ने कोडिंग, कंप्यूटर उपयोग और 1M टोकन संदर्भ में सुधार के साथ Claude Sonnet 4.6 जारी किया
|
| 2026-02-05 |
Claude Opus 4.6 |
80.8% |
Anthropic ने Claude Opus 4.6 जारी की, जिसमें 1M संदर्भ खिड़की और एजेंटिक सुधार शामिल हैं
|
| 2026-02-01 |
Claude Opus 4.6 |
80.8% |
डिकॉन्टामिनेटेड बेंचमार्क्स शीर्ष एआई कोडिंग मॉडल्स के बीच 12-पॉइंट का अंतर दिखाते हैं
|
| 2026-02-01 |
MiniMax M2.5 |
80.2% |
डिकॉन्टामिनेटेड बेंचमार्क्स शीर्ष एआई कोडिंग मॉडल्स के बीच 12-पॉइंट का अंतर दिखाते हैं
|
| 2026-01-28 |
Qwen3.6-27B |
77.2% |
Qwen 3.6-27B और DeepSeek V4 Flash स्थानीय कोडिंग बेंचमार्क्स में अग्रणी
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI ने GPT-5.2 जारी किया, जो कोडिंग और तर्कशीलता बेंचमार्क्स में Gemini 3 से बेहतर है
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI ने पेश किया GPT-5.2 जो पेशेवर ज्ञान कार्य के लिए अत्याधुनिक क्षमताओं से सुसज्जित है
|
| 2025-12-09 |
Devstral 2 |
72.2% |
Mistral ने Devstral 2 कोडिंग मॉडल और Mistral Vibe CLI जारी किए
|
| 2025-12-09 |
Devstral Small 2 |
68.0% |
Mistral ने Devstral 2 कोडिंग मॉडल और Mistral Vibe CLI जारी किए
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
77.9% |
OpenAI ने Codex CLI में GPT-5.1-Codex-Max को डिफ़ॉल्ट बना दिया
|
| 2025-11-19 |
Kimi K2 Thinking |
71.3% |
Moonshot AI ने एजेंटिक टूल उपयोग के साथ Kimi K2 Thinking जारी किया
|
| 2025-11-07 |
Kimi K2 Thinking |
71.3% |
Moonshot AI ने Kimi K2 Thinking जारी किया, एक ओपन-सोर्स 1T पैरामीटर तर्क मॉडल
|
| 2025-09-30 |
Claude Sonnet 4.5 |
77.2% |
Anthropic ने कोडिंग और एजेंट क्षमताओं में सुधार के साथ Claude Sonnet 4.5 जारी किया
|
| 2025-09-29 |
Claude Sonnet 4.5 |
77.2% |
Anthropic
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI ने रियल-टाइम राउटिंग और मुफ्त एक्सेस के साथ एकत्रीकृत GPT-5 लॉन्च किया
|
| 2025-08-07 |
GPT‑5 |
74.9% |
OpenAI ने कोडिंग और एजेंटिक सुधारों के साथ GPT-5 API जारी किया
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI ने एकत्रीकृत रूटिंग और विशेषज्ञ-स्तरीय तर्क के साथ GPT-5 पेश किया
|
| 2025-08-07 |
GPT-5 |
74.9% |
ओपनएआई ने अनुकूलित तर्कशक्ति और एकीकृत वास्तुकला के साथ GPT-5 लॉन्च किया
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI
|
| 2025-08-06 |
GLM-4.5 |
64.2% |
ज़ीपू एआई ने क्लॉड और डीपसीक के बराबर GLM-4.5 मॉडल जारी किए
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Moonshot ने Kimi K2 जारी किया, जो 32B सक्रिय पैरामीटर के साथ एक ओपन एजेंटिक MoE मॉडल है
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Kimi K2: 1T पैरामीटर और MuonClip ऑप्टिमाइज़र के साथ ओपन MoE मॉडल
|
| 2025-07-11 |
Kimi K2-Instruct |
65.8% |
Moonshot AI ने Kimi-K2-Instruct जारी किया, जो एजेंटिक क्षमताओं के साथ 1T-पैरामीटर MoE मॉडल है
|
| 2025-07-11 |
Kimi K2 |
65.8% |
Moonshot AI ने Kimi K2 जारी किया, जो एजेंटिक क्षमताओं के साथ 1T-पैरामीटर MoE मॉडल है
|
| 2025-07-10 |
Devstral Medium |
61.6% |
Mistral AI ने All Hands AI के साथ Devstral Small 1.1 और Devstral Medium जारी किए
|
| 2025-07-10 |
Devstral Small 1.1 |
53.6% |
Mistral AI ने All Hands AI के साथ Devstral Small 1.1 और Devstral Medium जारी किए
|
| 2025-05-30 |
Deepseek-R1-0528 |
57.6% |
DeepSeek ने R1 मॉडल को बेहतर तर्कशक्ति और बेंचमार्क स्कोर के साथ अपडेट किया
|
| 2025-05-23 |
Claude Sonnet 4 |
72.7% |
Anthropic ने हाइब्रिड तर्कशक्ति के साथ Claude Opus 4 और Sonnet 4 जारी किए
|
| 2025-05-23 |
Claude Opus 4 |
72.5% |
Anthropic ने हाइब्रिड तर्कशक्ति के साथ Claude Opus 4 और Sonnet 4 जारी किए
|
| 2025-05-22 |
Claude Opus 4 |
72.5% |
Anthropic
|
| 2025-05-21 |
Devstral |
46.8% |
Mistral AI ने सॉफ्टवेयर इंजीनियरिंग के लिए Devstral एजेंटिक LLM जारी किया
|
| 2025-04-17 |
o4-mini |
68.1% |
OpenAI ने o4-mini जारी किया, जो एक तेज़ और सस्ता बहुआयामी तर्क मॉडल है
|
| 2025-04-16 |
OpenAI o3 |
71.7% |
OpenAI
|
| 2025-04-14 |
GPT-4.1 |
54.6% |
OpenAI ने GPT-4.1 परिवार को 1M टोकन संदर्भ और कोडिंग सुधारों के साथ जारी किया
|
| 2025-04-14 |
GPT‑4.1 |
54.6% |
OpenAI ने API में GPT-4.1, GPT-4.1 mini और GPT-4.1 nano लॉन्च किए
|
| 2025-03-26 |
Gemini 2.5 Pro |
63.8% |
गूगल ने 1M टोकन संदर्भ के साथ एक्सपेरिमेंटल जेमिनी 2.5 प्रो रीजनिंग मॉडल जारी किया
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google ने Gemini 2.5 Pro प्रयोगात्मक मॉडल का परिचय दिया
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
गूगल ने गेमिनी 2.5 प्रो थिंकिंग मॉडल पेश किया
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google DeepMind
|
| 2025-03-05 |
GPT-4.5 |
38.0% |
OpenAI ने ChatGPT Plus के लिए अपना सबसे बड़ा मॉडल GPT-4.5 जारी किया
|
| 2025-02-24 |
Claude 3.7 Sonnet |
62.3% |
Anthropic
|
| 2025-01-06 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 Sonnet ने SWE-bench Verified पर 49% हासिल किया
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI ने तर्क और कोडिंग में उच्च प्रदर्शन के साथ o3 मॉडल जारी किया
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI ने ARC AGI और Frontier Math में सफलता के साथ o3 तर्क मॉडल का प्रीव्यू दिया
|
| 2024-10-30 |
Claude 3.5 Sonnet |
49.0% |
न्यूनतम एजेंट सॉफ़्टवेयर के साथ क्लॉड 3.5 सोनेट ने SWE-bench Verified पर 49% हासिल किया
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic ने Claude 3.5 Sonnet को अपग्रेड किया, Claude 3.5 Haiku और कंप्यूटर यूज़ बीटा जारी किया
|
| 2024-10-22 |
Claude 3.5 Haiku |
40.6% |
Anthropic ने Claude 3.5 Sonnet को अपग्रेड किया, Claude 3.5 Haiku और कंप्यूटर यूज़ बीटा जारी किया
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic
|
| 2024-08-13 |
Agentless |
32.0% |
OpenAI ने SWE-bench Verified जारी किया, जिसमें मानव-सत्यापित उपसमुच्चय शामिल है
|
| 2024-08-13 |
GPT‑4o |
33.2% |
OpenAI ने SWE-bench Verified जारी किया, जिसमें मानव-सत्यापित उपसमुच्चय शामिल है
|