विषय · Benchmark results
lab xAI News · 29 दिन पहले · 34 बार देखा गया

बायोसिक्योरिटी अस्वीकृति में ग्रॉक 4.6 अग्रणी है, जबकि सामान्य जैविक प्रदर्शन बनाए रखता है

लैचबायो ने अपने बायोसेकबेंच-रिफ्यूजल और बायोसेकबेंच-सर्वेयिलेंस बेंचमार्क्स पर ग्रॉक 4.6 का स्वतंत्र विश्लेषण प्रकाशित किया, जिसमें पाया गया कि मॉडल परीक्षित फ्रंटियर सिस्टम में छिपे हुए खतरनाक कार्यों को अस्वीकार करने में सबसे शक्तिशाली है।

lab NVIDIA Research · 19 दिन पहले · 21 बार देखा गया

ReasoningBomb बड़े तर्क मॉडलों में पथोलॉजिकल रूप से लंबे तर्क को प्रेरित करता है

शोधकर्ताओं ने इनफरेंस-टाइम डिनियल-ऑफ़-सर्विस (PI-DoS) हमलों को फॉर्मलाइज़ किया है जो Large Reasoning Models (LRMs) में एक्सप्लिसिट मल्टी-स्टेप तर्क के उच्च कंप्यूटेशनल कॉस्ट का शोषण करते हैं। वे ReasoningBomb प्रस्तुत करते हैं, एक रीइन्फोर्समेंट-लर्निंग-आधारित फ्रेमवर्क जो हमलावर को प्रशिक्षित करता है ताकि वह शिकार मॉडलों को पथोलॉजिकल रूप से लंबे और अक्सर नॉन-टर्मिनेटिंग तर्क ट्रेस में धकेलने वाले छोटे नेचुरल प्रॉम्प्ट्स उत्पन्न कर सके।

lab Hugging Face Blog · 1 दिन पहले · 8 बार देखा गया

शून्य-शॉट तालिका पूर्वानुमान के लिए NVIDIA ने खुला Kumo Tabular फाउंडेशन मॉडल जारी किया

NVIDIA ने Kumo Tabular जारी किया है, जो तालिका वर्गीकरण और रिग्रेशन के लिए एक खुला फाउंडेशन मॉडल है जो प्रशिक्षण या फीचर इंजीनियरिंग की आवश्यकता के बिना इन-कॉन्टेक्स्ट लर्निंग के माध्यम से संचालित होता है। स्ट्रक्चरल काज़ुअल मॉडल्स द्वारा उत्पन्न कृत्रिम डेटा पर ही प्रीट्रेन किया गया, इस मॉडल को 28M से 215M पैरामीटर तक के तीन आकारों में उपलब्ध कराया गया है।

media MarkTechPost · 1 दिन पहले · 4 बार देखा गया

Anthropic ने Claude Sonnet 5.5 को तेज़ गति और कम लागत के साथ जारी किया

Anthropic ने Claude Sonnet 5.5 जारी किया है, जो Claude 5.5 परिवार का दूसरा मॉडल है, जिसे दैनिक कार्यों, बग ठीक करने और दस्तावेज़ पॉलिशिंग के लिए Claude Opus 5.5 के लिए एक तेज़ और अधिक लागत-प्रभावी पूरक के रूप में स्थापित किया गया है।

media Don't Worry About the Vase · 4 दिन पहले · 12 बार देखा गया

Anthropic ने कम लागत में Fable 5.1-स्तर की प्रदर्शन क्षमता के साथ Claude Opus 5.5 जारी किया

Anthropic ने अपने नए Claude 5.5 परिवार का पहला मॉडल, Claude Opus 5.5 पेश किया है, जो अधिकांश कार्यों पर Claude Fable 5.1 के तुलनीय प्रदर्शन प्रदान करता है जबकि Opus 5 की तुलना में चलाने की लागत 40% कम है।

media The Batch · 5 दिन पहले Humanity's Last Exam · 61.4% · 11 बार देखा गया

Anthropic ने Claude Opus 5.5 जारी किया; TypeSafe ने Jev वर्गीकरण मॉडल लॉन्च किया

Anthropic ने Claude Opus 5.5 जारी किया है, जो Claude Opus 5 का कम लागत वाला उत्तराधिकारी है और सामान्य बुद्धिमत्ता मानकों में Artificial Analysis के Intelligence Index v4.3 और Vals AI के Vals Index में शीर्ष स्थान पर है। इसी समय, OpenAI के पूर्व कर्मचारी Diogo Almeida द्वारा स्थापित TypeSafe ने Jev पेश किया, जो पाठ का विश्लेषण करने और बड़े भाषा मॉडलों की तुलना में कम लागत पर पूर्वनिर्धारित आउटपुट लौटाने के लिए डिज़ाइन किया गया एक सामान्य वर्गीकरण मॉडल है।

media TLDR AI · 7 दिन पहले SWE-bench Pro · 23.0% · 24 बार देखा गया

OpenAI ने GPT-6 Sol और Luna जारी किए; Anthropic ने Claude Opus 5.5 लॉन्च किया

OpenAI ने GPT-6 Astra के लिए तेज़ और सस्ते विकल्प के रूप में GPT-6 Sol और Luna पेश किए, जो कोडिंग, तथ्यात्मकता, कंप्यूटर उपयोग और पेशेवर कार्यों में उन्नति लाते हुए कम लागत वाले मॉडल प्रदान करते हैं।

media MarkTechPost · 7 दिन पहले DeepSWE · 68.8% · 23 बार देखा गया

OpenAI ने 50% कम API मूल्यों के साथ GPT-6 Sol और Luna जारी किए

OpenAI ने दो नए मॉडल, GPT-6 Sol और GPT-6 Luna जारी किए हैं, जो अब OpenAI API में लाइव हैं। ये मॉडल पहले लॉन्च किए गए GPT-6 Astra के नीचे आते हैं और जटिल कोडिंग और उच्च-आयतन वाले दैनिक कार्यों के लिए तेज़, अधिक सुलभ स्तरों तक अपनी तकनीकी प्रगति लाने का लक्ष्य रखते हैं।

media Latent Space · 7 दिन पहले · 27 बार देखा गया

Anthropic ने Claude Opus 5.5 को बेहतर लेखन और कम लागत के साथ लॉन्च किया

Anthropic ने Claude Opus 5.5 जारी किया है, जो इसके नए Claude 5.5 परिवार का पहला मॉडल है, जिसे पिछली पीढ़ियों की तुलना में अधिक कुशल विकल्प के रूप में स्थापित किया गया है। इस मॉडल को अधिकांश कार्यों के लिए Claude Fable 5.1 के स्तर पर प्रदर्शन करने के लिए डिज़ाइन किया गया है, जबकि Opus 5 की तुलना में इसे चलाने की लागत 40% कम है।

media MarkTechPost · 8 दिन पहले · 20 बार देखा गया

Anthropic ने 40% कम लागत पर Fable 5.1 प्रदर्शन के साथ Claude Opus 5.5 जारी किया

Anthropic ने Claude Opus 5.5 जारी किया है, जो अपने नए Claude 5.5 परिवार का पहला मॉडल है, जो अधिकांश कार्य में Claude Fable 5.1 के स्तर पर प्रदर्शन करता है और Opus 5 की तुलना में चलाने की लागत 40% कम है।

media MarkTechPost · 8 दिन पहले GDPval-AA (Elo) · 1695.0Elo · 23 बार देखा गया

SpaceXAI ने बड़े बेस मॉडल और सुधारे गए बेंचमार्क्स के साथ Grok 4.7 जारी किया

SpaceXAI ने Grok 4.7 जारी किया है, जो कोडिंग, एजेंटिक कार्यों और ज्ञान कार्य के लिए एक नया फ्लैगशिप मॉडल है जो Grok 4.6 की तुलना में बड़े बेस मॉडल और विस्तारित रीइंफोर्समेंट लर्निंग रन का उपयोग करता है। मॉडल अपने पूर्ववर्ती के समान ही मूल्य निर्धारण संरचना बनाए रखता है, जबकि स्व-सत्यापन, लंबे संदर्भ हैंडलिंग और सुरक्षा में बढ़ी हुई क्षमताएं प्रदान करता है।

media The Batch · 19 दिन पहले GPQA Diamond · 96.3% · 32 बार देखा गया

OpenAI ने GPT-6 Astra लॉन्च किया, कम लागत के साथ लीडरबोर्ड में शीर्ष स्थान हासिल किया

OpenAI ने GPT-6 Astra जारी किया है, जो इसका नया फ्लैगशिप विजन-लैंग्वेज मॉडल है और प्रमुख AI लीडरबोर्ड पर शीर्ष या लगभग शीर्ष रैंकिंग प्राप्त करता है, जबकि प्रतिस्पर्धी मॉडलों की तुलना में काफी कम टोकन का उपयोग करता है और कम लागत आती है। मॉडल को OpenAI के महत्वपूर्ण साइबर सुरक्षा स्तर को पूरा करने के लिए डिज़ाइन किया गया है, जिसमें उन्नत साइबर क्षमताओं को चुनिंदा संगठनों तक सीमित रखा गया है।

media Latent Space · 27 दिन पहले · 28 बार देखा गया

OpenAI ने अपने नए फ्लैगशिप मॉडल के रूप में GPT-6 Astra लॉन्च किया

OpenAI ने आधिकारिक तौर पर GPT-6 Astra को लॉन्च किया है, इसे अपनी अब तक की सबसे बुद्धिमान और संरेखित मॉडल के रूप में स्थापित करते हुए। यह रोलआउट कंप्यूटर उपयोग, सॉफ्टवेयर इंजीनियरिंग, गणित और विज्ञान, कार्यालय कार्य और साइबर सुरक्षा को निशाना बनाता है।

blog Simon Willison · 27 दिन पहले Artificial Analysis Intelligence Index · 66.0% · 51 बार देखा गया

OpenAI ने ARC-AGI 3 और सुरक्षा सुधारों के साथ GPT-6 Astra जारी किया

OpenAI ने GPT-6 Astra जारी किया है, एक नया मॉडल जो ChatGPT Plus, Pro, Business, और Enterprise उपयोगकर्ताओं के लिए उपलब्ध है, साथ ही OpenAI API और AWS के माध्यम से भी। इस मॉडल की कीमत $10/लाख इनपुट टोकन और $50/लाख आउटपुट टोकन है, जिससे इसे Claude Fable 5 का प्रतिद्वंदी के रूप में स्थापित किया गया है।

media Latent Space · 28 दिन पहले · 47 बार देखा गया

Anthropic ने नए SOTA बेंचमार्क्स के साथ Claude Fable और Mythos 5.1 लॉन्च किए

Anthropic ने कोडिंग और ज्ञान कार्य के लिए अपने नए फ्लैगशिप मॉडल के रूप में Claude Fable 5.1 और Claude Mythos 5.1 जारी किए हैं, उन्हें स्वतंत्र, बहु-चरण कार्यों के लिए दुनिया के सबसे उन्नत मॉडल के रूप में स्थापित करते हुए।

media AI News (smol.ai) · 29 दिन पहले · 50 बार देखा गया

Anthropic ने क्लॉड फेबल 5.1 और माइथोस 5.1 को कम कैश मूल्य निर्धारण के साथ लॉन्च किया

Anthropic ने कोडिंग और ज्ञान कार्य के लिए अपने नए फ्लैगशिप मॉडल के रूप में क्लॉड फेबल 5.1 और क्लॉड माइथोस 5.1 जारी किए हैं, जिन्हें स्वतंत्र, बहु-चरण कार्यों की क्षमता वाला बताया गया है। इस रिलीज में प्रति मिलियन टोकन $0.25 के कैश रीड मूल्य में महत्वपूर्ण कमी और 1 मिलियन टोकन संदर्भ विंडो शामिल है।

media MarkTechPost · 29 दिन पहले GDPval-AA (Elo) · 1853.0Elo · 53 बार देखा गया

Anthropic ने Claude Fable 5.1 को Terminal-Bench-Science पर 52.6% और सस्ते कैश रीड के साथ जारी किया

Anthropic ने Claude Fable 5.1 और प्रतिबंधित Claude Mythos 5.1 जारी किए हैं, दोनों एक ही अंतर्निहित मॉडल साझा करते हैं लेकिन सुरक्षा परतों में भिन्न होते हैं। Fable 5.1 प्रमुख क्लाउड प्रदाताओं के लिए सामान्य रूप से उपलब्ध है, जबकि Mythos 5.1 केवल सत्यापित संगठनों तक सीमित है।

media MarkTechPost · 6 घंटे पहले

NVIDIA के शोधकर्ताओं ने Cosmos 3 वीडियो मॉडल में भौतिक तर्क को बेहतर बनाने के लिए Physis-Lang जारी किया

NVIDIA, MIT और ऑक्सफोर्ड विश्वविद्यालय के शोधकर्ताओं ने Physis-Lang पेश किया है, एक फ्रेमवर्क जो कैप्शन में स्व-विकासशील भौतिक भाषा को एकीकृत करके वीडियो वर्ल्ड मॉडल को बढ़ावा देता है। यह दृष्टिकोण भौतिक भाषा को डेटा चयन, मॉडल प्रशिक्षण और उत्पन्न वीडियों में भौतिक त्रुटियों को ठीक करने के लिए उपयोग की जाने वाली एक अनुकूलनीय निरूपण के रूप में मानता है।

media Hugging Face Forums · 9 घंटे पहले

AI Compute Radar ने Heat Score के आधार पर Alibaba Qwen और Google को शीर्ष ओपन मॉडल लैबों में रैंक किया

AI Compute Radar ने एक "Maker बोर्ड" प्रकाशित किया है जो 46 ओपन मॉडल्स की अपनी ट्रैक्ड सेट में योगदान देने वाले 15 लैबों को Heat Score नामक संयुक्त मेट्रिक का उपयोग करके रैंक करता है। रैंकिंग प्रत्येक लैब द्वारा टॉप 10 में मौजूद मॉडल्स की संख्या पर निर्धारित होती है, और बराबरी को सर्वश्रेष्ठ स्थिति और 30-दिन के डाउनलोड के योग से तोड़ा जाता है।

blog Simon Willison · 21 घंटे पहले · 2 बार देखा गया

Anthropic को पता चला कि GLM-5.3 साइबर रेड टीमिंग में पूर्ण कंट्रोल फ्लो हाइजैक प्राप्त करता है

Anthropic के Frontier Red Team ने आंतरिक Binary Exploitation बेंचमार्क से 100 कार्यों पर चीनी मॉडल GLM-5.3 का मूल्यांकन किया और पाया कि यह 4% प्रयासों में पूर्ण कंट्रोल फ्लो हाइजैक विकसित करने में सक्षम है।