Benchmark results
media MarkTechPost · अभी अभी DeepSWE · 68.8% · 1 बार देखा गया लाइव

OpenAI ने 50% कम API मूल्यों के साथ GPT-6 Sol और Luna जारी किए

OpenAI ने दो नए मॉडल, GPT-6 Sol और GPT-6 Luna जारी किए हैं, जो अब OpenAI API में लाइव हैं। ये मॉडल पहले लॉन्च किए गए GPT-6 Astra के नीचे आते हैं और जटिल कोडिंग और उच्च-आयतन वाले दैनिक कार्यों के लिए तेज़, अधिक सुलभ स्तरों तक अपनी तकनीकी प्रगति लाने का लक्ष्य रखते हैं।

media Latent Space · अभी अभी · 4 बार देखा गया लाइव

Anthropic ने Claude Opus 5.5 को बेहतर लेखन और कम लागत के साथ लॉन्च किया

Anthropic ने Claude Opus 5.5 जारी किया है, जो इसके नए Claude 5.5 परिवार का पहला मॉडल है, जिसे पिछली पीढ़ियों की तुलना में अधिक कुशल विकल्प के रूप में स्थापित किया गया है। इस मॉडल को अधिकांश कार्यों के लिए Claude Fable 5.1 के स्तर पर प्रदर्शन करने के लिए डिज़ाइन किया गया है, जबकि Opus 5 की तुलना में इसे चलाने की लागत 40% कम है।

media MarkTechPost · 9 घंटे पहले · 9 बार देखा गया

Anthropic ने 40% कम लागत पर Fable 5.1 प्रदर्शन के साथ Claude Opus 5.5 जारी किया

Anthropic ने Claude Opus 5.5 जारी किया है, जो अपने नए Claude 5.5 परिवार का पहला मॉडल है, जो अधिकांश कार्य में Claude Fable 5.1 के स्तर पर प्रदर्शन करता है और Opus 5 की तुलना में चलाने की लागत 40% कम है।

lab Hugging Face Blog · 15 घंटे पहले · 9 बार देखा गया

AISI ने पांच बेंचमार्क पर छह फ्रंटियर मॉडल के लिए सत्यापित मूल्यांकन परिणाम जारी किए

UK AI Security Institute (AISI) ने बेंचमार्क पुनरुत्पादन को बेहतर बनाने के लिए EvalEval के Evaluation Cards प्लेटफ़ॉर्म के माध्यम से सार्वजनिक रूप से रिपोर्ट की गई मूल्यांकन विधियों और निष्कर्षों को उपलब्ध कराया है। इस रिलीज़ में पांच विशिष्ट बेंचमार्क: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, और Terminal-Bench 2.0 के लिए सत्यापित परिणाम, संदर्भ और कॉन्फ़िगरेशन जानकारी शामिल है।

media MarkTechPost · 21 घंटे पहले GDPval-AA (Elo) · 1695.0Elo · 13 बार देखा गया

SpaceXAI ने बड़े बेस मॉडल और सुधारे गए बेंचमार्क्स के साथ Grok 4.7 जारी किया

SpaceXAI ने Grok 4.7 जारी किया है, जो कोडिंग, एजेंटिक कार्यों और ज्ञान कार्य के लिए एक नया फ्लैगशिप मॉडल है जो Grok 4.6 की तुलना में बड़े बेस मॉडल और विस्तारित रीइंफोर्समेंट लर्निंग रन का उपयोग करता है। मॉडल अपने पूर्ववर्ती के समान ही मूल्य निर्धारण संरचना बनाए रखता है, जबकि स्व-सत्यापन, लंबे संदर्भ हैंडलिंग और सुरक्षा में बढ़ी हुई क्षमताएं प्रदान करता है।

media Interconnects · 2 दिन पहले Artificial Analysis Intelligence Index · 45.0% · 17 बार देखा गया

चीनी ओपन-वेट मॉडल डाउनलोड और बेंचमार्क में अमेरिकी प्रतिद्वंद्वियों को पछाड़ते हैं

लेखक ने ओपन-वेट मॉडलों की स्थिति पर एक संक्षिप्त विवरण प्रस्तुत किया है, यह नोट करते हुए कि चीनी एआई कंपनियां अप्रैल 2025 के आसपास से इस क्षेत्र में स्पष्ट रूप से अग्रणी बन गई हैं। यह बदलाव Hugging Face डाउनलोड मेट्रिक्स और क्षमता बेंचमार्क पर प्रदर्शन द्वारा प्रमाणित होता है।

media Hugging Face Forums · 6 दिन पहले · 13 बार देखा गया

एजेंट वेस्ट इंडेक्स ने 341,054 सार्वजनिक कोडिंग-एजेंट रन के लिए वेस्ट पैटर्न पर स्कोर दिया

एजेंट वेस्ट इंडेक्स ने दक्षताहीनताओं जैसे लूप, अंधेरे पुनः प्रयासों, अत्यधिक बड़े टूल आउटपुट और छोड़ दिए गए रन की पहचान करने के लिए 11 सार्वजनिक डेटासेट से 341,054 एजेंट ट्रैजेक्टरी का स्कोर दिया है। विश्लेषण से पता चलता है कि लूप और पुनः प्रयास व्यवहार Llama जैसे कमजोर मॉडल्स में व्यापक हैं, लेकिन Claude 3.7 Sonnet और Qwen3-Coder-480B में दुर्लभ हैं।

media r/LocalLLaMA · 7 दिन पहले · 18 बार देखा गया

मोज़िला की रिपोर्ट के अनुसार चीन के ओपन-वेट AI मॉडल अमेरिका के फ्रंटियर ऑफरिंग्स से 4 महीने पीछे हैं

मोज़िला की एक रिपोर्ट संकेत देती है कि चीन के ओपन-वेट AI मॉडलों ने विकास में अंतर को केवल चार महीने तक कम कर दिया है। इस तेज़ प्रगति के बावजूद, मॉडल कुछ बेंचमार्क मूल्यांकनों में पीछे रहते हैं।

media r/LocalLLaMA · 7 दिन पहले Artificial Analysis Intelligence Index · 45.0% · 51 बार देखा गया

Artificial Analysis Intelligence Index में Qwen3.8 Max (0902) ने 45 अंक हासिल किए

Qwen3.8 Max (0902) मॉडल ने Artificial Analysis Intelligence Index में 45 का स्कोर प्राप्त किया है, जिसने चीन की लीडरबोर्ड पर शीर्ष स्थान वापस हासिल कर लिया।

media MarkTechPost · 7 दिन पहले LMSYS Arena (Elo) · 1866.0Elo · 20 बार देखा गया

प्रायर लैब्स ने डिफ़ॉल्ट सेटिंग्स के साथ 2015 ओटो कैगल विजेता को हराते हुए TabPFN-3.5 जारी किया

प्रायर लैब्स ने TabPFN-3.5 जारी किया, जो एक टैबुलर फाउंडेशन मॉडल है जो डेटासेट-विशिष्ट प्रशिक्षण या ट्यूनिंग के बिना एकल फॉरवर्ड पास में तालिका पर भविष्यवाणी करता है। मॉडल 2015 ओटो ग्रुप प्रोडक्ट क्लासिफिकेशन चैलेंज के प्राइवेट लीडरबोर्ड पर 0.375 स्कोर प्राप्त करता है, जिसमें गिल्बर्टो टिटेरिज़ और स्टानिसलाव सेमेनोव द्वारा हासिल किए गए मूल विजेता स्कोर 0.382 को हराया गया।

media r/LocalLLaMA · 7 दिन पहले · 17 बार देखा गया

मोज़िला की रिपोर्ट में पाया गया कि चीन-अमेरिका AI मॉडल क्षमता अंतर 4.4 महीने तक संकर गया है

एक मोज़िला रिपोर्ट के अनुसार, चीनी और अमेरिकी कृत्रिम बुद्धिमत्ता मॉडलों के बीच क्षमता अंतर काफी कम हो गया है, जो घटकर 4.4 महीने का रह गया है।

media MarkTechPost · 7 दिन पहले · 28 बार देखा गया

Nums AI ने Causilo जारी किया, एक तालिका आधारित मॉडल जो एकाकी मॉडलों में TabArena में शीर्ष पर है

Nums AI ने वर्गीकरण और रिग्रेशन के लिए एक प्रीट्रेन तालिका फाउंडेशन मॉडल Causilo जारी किया, जो TabArena पर एकाकी मॉडलों में सबसे उच्च Elo स्कोर हासिल करता है। यह मॉडल इन-कंटैक्स्ट लर्निंग दृष्टिकोण का उपयोग करता है जहां ट्रेनिंग पंक्तियों को वजन अपडेट करने के बजाय संदर्भ के रूप में संग्रहीत किया जाता है, और इसका Apache-2.0 कोड और प्रीट्रेन वजन Hugging Face पर उपलब्ध हैं।

arxiv arXiv cs.CL · 8 दिन पहले Codeforces (Elo) · 98.2% · 27 बार देखा गया

स्टेलर कोलिसियम लॉन्ग-होराइजन गणित शोध के लिए मल्टी-एजेंट इनफरेंस का उपयोग करता है

स्टेलर कोलिसियम एक मॉडल-अग्नोस्टिक हार्नेस है जो गणित और सैद्धांतिक कंप्यूटर साइंस में लॉन्ग-होराइजन शोध के लिए इनफरेंस को आवंटित करने के लिए डिज़ाइन किया गया है, जटिल समस्याओं पर भाषा मॉडलों की अविश्वसनीयता को दूर करता है। सिस्टम प्रूफ निर्माण से पहले वैकल्पिक रणनीतियों का अन्वेषण करता है, एक तैयारी गेट का उपयोग करता है यह निर्धारित करने के लिए कि कोई मार्ग विघटन के लिए पर्याप्त परिपक्व है या नहीं, और प्रूफ योजना को अंतर्निहित खंड-स्तर की उप-समस्याओं के रूप में दर्शाता है।

arxiv arXiv cs.LG · 8 दिन पहले Codeforces (Elo) · 98.2% · 25 बार देखा गया

स्टेलर कोलिसियम: लॉग-होराइजन गणित और TCS शोध के लिए मल्टी-एजेंट हैर्नेस

लेखकों ने स्टेलर कोलिसियम का परिचय दिया है, जो एक मॉडल-अग्नोस्टिक हैर्नेस है जिसे गणित और सैद्धांतिक कंप्यूटर विज्ञान में लॉग-होराइजन शोध के लिए इनफरेंस को आवंटित करने के लिए डिज़ाइन किया गया है। सिस्टम प्रूफ निर्माण से पहले वैकल्पिक रणनीतियों का अन्वेषण करता है, एक तैयारी गेट का उपयोग करता है यह निर्धारित करने के लिए कि कोई मार्ग विघटन के लिए पर्याप्त परिपक्व है या नहीं, और प्रूफ योजना को आपसी निर्भर खंड-स्तर की उपसमस्याओं के रूप में दर्शाता है।

media r/LocalLLaMA · 8 दिन पहले · 12 बार देखा गया

Base-10 का चार्ली ओ'नील कहता है कि Kimi और GLM, Opus 5 से बेहतर हैं

Dwarkesh Patel के साथ एक हालिया एपिसोड में Base-10 के चार्ली ओ'नील ने चर्चा की कि Kimi और GLM मॉडल "लगभग वस्तुनिष्ठ रूप से" Opus 5 से बेहतर क्यों हैं।

arxiv arXiv cs.AI · 9 दिन पहले · 25 बार देखा गया

विशेषज्ञों द्वारा पुनः ग्रेडिंग से पता चलता है कि प्रमुख मॉडल भौतिकी बेंचमार्क पर लगभग संतृप्ति की अवस्था में हैं

छह व्यापक रूप से उपयोग किए जाने वाले भौतिकी बेंचमार्क का ऑडिट करने वाली एक अध्ययन में पाया गया कि प्रमुख भाषा मॉडल के लिए रिपोर्ट किए गए कम स्कोर मुख्य रूप से बेंचमार्किंग त्रुटियों के कारण हैं, न कि मॉडल की कमी के। विशेषज्ञों ने समस्या विवरणों, संदर्भ समाधानों और मॉडल प्रतिक्रियाओं की समीक्षा की, वास्तविक त्रुटियों को ग्रेडर की गलतियों, गलत संदर्भों और अस्पष्ट प्रश्नों से अलग किया।

lab Cohere Blog · 10 दिन पहले · 35 बार देखा गया

Cohere ने North Small Translate जारी किया, एक संप्रभु ओपन-वेट MT मॉडल

Cohere ने North Small Translate जारी किया है, जो North परिवार में इसका पहला अनुवाद मॉडल है, जो CC BY-NC 4.0 लाइसेंस के तहत शोध और गैर-वाणिज्यिक उपयोग के लिए उपलब्ध है। यह मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल WMT26 All Languages बेंचमार्क पर 83.6 स्कोर हासिल करता है, जो DeepL NextGen और Google Translate जैसे प्रोप्राइटरी मॉडल्स से बेहतर है।

media MarkTechPost · 10 दिन पहले Terminal-Bench 2 · 92.8% · 28 बार देखा गया

Cognition ने SWE-2 जारी किया, जो चयन योग्य तर्क प्रयास के साथ Kimi K3 पोस्ट-ट्रेन्ड कोडिंग मॉडल है

Cognition ने SWE-2 जारी किया है, जो आज तक इसका सबसे सक्षम कोडिंग मॉडल है, जिसका Moonshot AI के 2.8T-पैरामीटर वाले ओपन मॉडल Kimi K3 से पुनर्बल सीखने (reinforcement learning) के साथ पोस्ट-ट्रेनिंग की गई है। FrontierCode 1.1 Main पर मॉडल ने 50.0% स्कोर हासिल किया, जो इसे Fable 5.1 से केवल एक अंक पीछे रखता है, जबकि लागत 64% कम है।

lab NVIDIA Research · 11 दिन पहले · 16 बार देखा गया

ReasoningBomb बड़े तर्क मॉडलों में पथोलॉजिकल रूप से लंबे तर्क को प्रेरित करता है

शोधकर्ताओं ने इनफरेंस-टाइम डिनियल-ऑफ़-सर्विस (PI-DoS) हमलों को फॉर्मलाइज़ किया है जो Large Reasoning Models (LRMs) में एक्सप्लिसिट मल्टी-स्टेप तर्क के उच्च कंप्यूटेशनल कॉस्ट का शोषण करते हैं। वे ReasoningBomb प्रस्तुत करते हैं, एक रीइन्फोर्समेंट-लर्निंग-आधारित फ्रेमवर्क जो हमलावर को प्रशिक्षित करता है ताकि वह शिकार मॉडलों को पथोलॉजिकल रूप से लंबे और अक्सर नॉन-टर्मिनेटिंग तर्क ट्रेस में धकेलने वाले छोटे नेचुरल प्रॉम्प्ट्स उत्पन्न कर सके।