Open weights
media MarkTechPost · 1 दिन पहले · 1 बार देखा गया

Mistral AI ने Shieldstral 1.0 3B जारी किया, एक नीति-अनुकूलित बहुमोडल सुरक्षा वर्गीकारक

Mistral AI ने Shieldstral 1.0 3B जारी किया है, एक ओपन-वेट्स मॉडल जो सामग्री मॉडरेशन को एक साधारण हाँ/नहीं प्रश्न के रूप में देखता है, बजाय निश्चित हानि श्रेणियों पर निर्भर करने के। Ministral-3-3B-Base-2512 और Pixtral विजन एन्कोडर पर बनाया गया, यह ऑपरेटरों को रीट्रेनिंग के बिना इनफरेंस समय में साधारण भाषा प्रॉम्प्स के माध्यम से नीतियों को परिभाषित करने की अनुमति देता है।

media r/LocalLLaMA · 1 दिन पहले · 5 बार देखा गया

अमेरिकी ऊर्जा विभाग ने जेनेसिस ओपन मॉडल्स इनिशिएटिव शुरू किया और जेनेसिस-साइंस-1 का अनावरण किया

अमेरिकी ऊर्जा विभाग ने जेनेसिस ओपन मॉडल्स इनिशिएटिव शुरू किया है और Arcee के साथ साझेदारी में वैज्ञानिक शोध के लिए अपने पहले ओपन-वेट मॉडल, जेनेसिस-साइंस-1 का अनावरण किया है।

media MarkTechPost · 1 दिन पहले

NVIDIA ने AI एजेंट्स बनाने के लिए एक ऑब्जेक्ट-ओरिएंटेड Python फ्रेमवर्क NOOA जारी किया

NVIDIA Labs ने NOOA (NVIDIA Object-Oriented Agents) को ओपन-सोर्स कर दिया है, जो एक मॉडल-अग्नोस्टिक Python फ्रेमवर्क है जो एजेंट विकास को एकल Python क्लास में समेटता है। यह दृष्टिकोण प्रॉम्प्ट टेम्पलेट्स और वर्कफ्लो ग्राफ्स वाले बिखरे हुए वर्कफ्लोज को प्रतिस्थापित करता है, जिसमें विधियों को एक्शन, फील्ड्स को स्टेट, डॉकस्ट्रिंग्स को प्रॉम्प्ट्स, और टाइप एनोटेशन को लागू अनुबंधों में मैप किया जाता है।

media TLDR AI · 2 दिन पहले · 2 बार देखा गया

Google ने WeatherNext मॉडल ओपन-सोर्स किए; Meta क्रॉस-मोडल सहयोग की खोज कर रहा है

Google ने चक्रवात पूर्वानुमान की सटीकता को बेहतर बनाने के लिए अपने WeatherNext 2 और WeatherNext Cyclones AI मॉडल्स को ओपन-सोर्स किया है। मॉडल ट्रैक, तीव्रता और हवा की संरचना की भविष्यवाणी में state-of-the-art परिणाम हासिल करते हैं, जो वर्तमान विधियों की तुलना में पूर्वानुमानकर्ताओं को औसतन एक अतिरिक्त दिन की पूर्वानुमान सटीकता प्रदान करते हैं।

media The Batch · 2 दिन पहले Code Arena (Elo) · 1577.0Elo · 1 बार देखा गया

DeepSeek ने V4-Flash-0731 जारी किया, कम लागत में V4-Pro से बेहतर प्रदर्शन

DeepSeek ने DeepSeek-V4-Flash-0731 जारी किया है, जो अपने छोटे "Flash" मॉडल का एक अपडेटेड संस्करण है जो स्वतंत्र बेंचमार्क पर बड़े DeepSeek-V4-Pro से बेहतर प्रदर्शन करता है। इस रिलीज में मूल Mixture-of-Experts आर्किटेक्चर को 284 अरब कुल पैरामीटर के साथ बनाए रखते हुए एक नया फाइन-ट्यूनिंग प्रक्रिया का उपयोग किया गया है।

media r/LocalLLaMA · 2 दिन पहले · 1 बार देखा गया

Moonshot ने Kimi K3 ओपन-वेट मॉडल जारी किया

चीनी AI कंपनी Moonshot ने अपने Kimi K3 मॉडल को एक ओपन-वेट ऑफरिंग के रूप में जारी किया है। यह रिलीज़ उन रिपोर्ट्स के बाद आई है कि शक्तिशाली मॉडल पहले ही कंटेंमेंट उपायों से बच चुका था।

media MarkTechPost · 2 दिन पहले · 1 बार देखा गया

Liquid AI ने LFM2.5-2.6B जारी किया, एक ओपन-वेट ऑन-डिवाइस एजेंटिक मॉडल

Liquid AI ने LFM2.5-2.6B जारी किया है, जो 2.69 बिलियन पैरामीटर वाला एक मॉडल है जिसे फोन, लैपटॉप और रोबोट जैसी स्थानीय डिवाइस पर पूरी तरह से चलाने के लिए डिज़ाइन किया गया है। इस मॉडल में 131,076-टोकन संदर्भ विंडो है और लगभग 34 ट्रिलियन टोकन पर प्री-ट्रेन किया गया था।

lab Google DeepMind Blog · 3 दिन पहले · 16 बार देखा गया

चक्रवात पूर्वानुमान के लिए Google DeepMind ने WeatherNext AI मॉडल को ओपन सोर्स किया

Google DeepMind और Google Research ने WeatherNext 2 और WeatherNext Cyclones AI मॉडल को ओपन सोर्स किया है, जो उष्णकटिबंधीय चक्रवात के मार्ग, तीव्रता और वायु संरचना की भविष्यवाणी में शीर्ष स्तर की सटीकता हासिल करते हैं। Nature में प्रकाशित इस कार्य से पता चलता है कि ये मॉडल पूर्वानुमानकों को पिछले सिस्टम की तुलना में भविष्यवाणी की सटीकता में एक दिन का अतिरिक्त लाभ प्रदान करते हैं।

media Hugging Face Forums · 3 दिन पहले · 1 बार देखा गया

QuantCheck चेतावनी देता है कि अंतिम चेकपॉइंट को 4-बिट क्वांटीकरण के लिए सर्वोत्तम मानने से बचें

QuantCheck नामक एक नया टूल इस बात पर प्रकाश डालता है कि प्रीट्रेनिंग का अंतिम चेकपॉइंट 4-बिट क्वांटीकरण के लिए इष्टतम विकल्प नहीं हो सकता है, क्योंकि बेंचमार्क्स समान रह सकते हैं जबकि भंगुरता बढ़ जाती है। लेखक ने Pythia-160m पर इस पैटर्न को देखा, जहाँ अंतिम चेकपॉइंट ने गुणवत्ता में लगभग चार गुना अधिक नुकसान झेला, जबकि समान गुणवत्ता वाला एक पूर्व चेकपॉइंट था।

media MarkTechPost · 4 दिन पहले · 1 बार देखा गया

NVIDIA ने स्वचालित ड्राइविंग के लिए 34B ओपन VLA मॉडल Alpamayo 2 Super जारी किया

NVIDIA ने OpenMDW-1.1 लाइसेंस के तहत रोबोटैक्स और स्वचालित ड्राइविंग के लिए डिज़ाइन किए गए 34-अरब पैरामीटर वाले विजन-लैंग्वेज-एक्शन (VLA) मॉडल Alpamayo 2 Super को जारी किया है। मॉडल मल्टी-कैमरा वीडियो से ट्रेजेक्टरी, कारण स्पष्टीकरण और मेटा-एक्शन उत्पन्न करने के लिए 32B Cosmos 3 Super Reasoner बैकबोन को 2.3B डिफ्यूजन-आधारित एक्शन डिकोडर के साथ जोड़कर लॉन्ग-टेल इवेंट्स पर ध्यान केंद्रित करता है।

media r/LocalLLaMA · 4 दिन पहले

अमेरिका ने चीनी ओपन-वेट मॉडल को सुरक्षा परीक्षणों से छूट दी

संयुक्त राज्य अमेरिका ने चीनी ओपन-वेट आर्टिफिशियल इंटेलिजेंस मॉडल को अनिवार्य सुरक्षा परीक्षण आवश्यकताओं से छूट देने का निर्णय लिया है। इस नीति परिवर्तन का अर्थ है कि इन विशिष्ट मॉडल विकसित करने वाली कंपनियां अब सामान्य अमेरिकी सुरक्षा मूल्यांकनों के अधीन नहीं होंगी।

media AI News (smol.ai) · 4 दिन पहले Terminal-Bench 2 · 67.4% · 8 बार देखा गया

अलibaba ने 2.4T पैरामीटर और आगामी ओपन वेट्स के साथ Qwen3.8-Max की घोषणा की

अलibaba ने अपने नए फ्लैगशिप मॉडल के रूप में Qwen3.8-Max की घोषणा की है, जिसे लंबे समय तक चलने वाले एजेंटिक कार्य, कोडिंग और बहुआयामी तर्क पर केंद्रित 2.4T-पैरामीटर स्पार्स आर्किटेक्चर के रूप में वर्णित किया गया है। कंपनी ने पुष्टि की कि Qwen3.8-Max के लिए ओपन वेट्स अगले सप्ताह ओपन-वेट Qwen3.8-27B वेरिएंट के साथ जारी किए जाएंगे।

media r/LocalLLaMA · 4 दिन पहले · 1 बार देखा गया

Mistral AI ने Shieldstral का परिचय दिया

Mistral AI ने Shieldstral नामक एक नए मॉडल के परिचय की घोषणा की है। स्रोत सामग्री में केवल शीर्षक और सबमिशन मेटाडेटा प्रदान किए गए हैं, मॉडल की सुविधाओं, क्षमताओं या उद्देश्य के बारे में कोई अतिरिक्त विवरण नहीं है।

lab Liquid AI · 5 दिन पहले · 5 बार देखा गया

LFM2.5-2.6B ने फ्री लोकल इनफरेंस के साथ एक ऑन-डिवाइस एजेंटिक मॉडल जारी किया

लेखकों ने LFM2.5-2.6B जारी किया है, जो 2.6B पैरामीटर वाला एक एजेंटिक मॉडल है जिसे प्लानिंग, टूल कॉलिंग और मल्टी-स्टेप टास्क के लिए पूरी तरह से ऑन-डिवाइस चलाने के लिए डिज़ाइन किया गया है। यह फोन पर चलने के लिए पर्याप्त रूप से छोटा है और सीपीयू पर प्रतिक्रियाशील रहने के लिए पर्याप्त रूप से तेज़ है, जिसमें क्लाउड एपीआई निर्भरता के बिना फ्री इनफरेंस, कम लेटेंसी और गोपनीयता शामिल है।

lab Hugging Face Blog · 5 दिन पहले · 2 बार देखा गया

Liquid AI ने स्थानीय एजेंटिक डिप्लॉयमेंट के लिए LFM2.5-2.6B जारी किया

Liquid AI ने LFM2.5-2.6B मॉडल जारी किया है, जो एक 2.6-अरब पैरामीटर एजेंट है जिसे उच्च दक्षता और संगतता के साथ किनारे के उपकरणों पर स्थानीय रूप से चलाने के लिए डिज़ाइन किया गया है।

lab Mistral AI News · 5 दिन पहले · 3 बार देखा गया

Shieldstral ने पॉलिसी-अनुकूलित 3B बहुमोडल सुरक्षा वर्गीकारक का परिचय दिया

Shieldstral एक 3B ओपन-वेट्स बहुमोडल सुरक्षा वर्गीकारक है जो सामग्री मॉडरेशन को एक पॉलिसी-अनुकूलित प्रश्न-उत्तर कार्य के रूप में परिभाषित करता है, जिससे इसे पुनः प्रशिक्षण के बिना निष्पादन समय पर साधारण भाषा की नीतियों को स्वीकार करने की क्षमता प्राप्त होती है। यह पाठ और छवि सुरक्षा मूल्यांकन को एकीकृत करता है और विभिन्न बेंचमार्क्स पर संतुलित सुरक्षा स्कोर प्रदान करते हुए एकल 16GB NVIDIA GPU पर कुशलता से चलता है।

media Latent Space · 5 दिन पहले · 2 बार देखा गया

अलिबाबा ने अगले सप्ताह ओपन वेट के साथ 2.4T-पैरामीटर मॉडल Qwen 3.8 Max की घोषणा की

अलिबाबा का Qwen टीम ने कोडिंग, लॉंग-होराइजन एजेंटिक वर्क और मल्टीमोडल रीज़निंग पर केंद्रित एक नए 2.4T-पैरामीटर फ्लैगशिप मॉडल Qwen 3.8 Max की घोषणा की है। कंपनी ने पुष्टि की कि Qwen 3.8 Max और छोटे Qwen 3.8-27B दोनों के ओपन-वेट वर्जन अगले सप्ताह रिलीज़ किए जाएंगे।

media r/LocalLLaMA · 5 दिन पहले

NVIDIA ने Hugging Face पर NemotronLabs-VoiceChat-11B मॉडल जारी किया

NVIDIA ने Hugging Face पर NemotronLabs-VoiceChat-11B वॉइस चैट मॉडल उपलब्ध कराया है। रिपॉजिटरी को पूर्ण डुप्लेक्स संचार क्षमताओं का समर्थन करने के रूप में वर्णित किया गया है।