Multimodal
media MarkTechPost · 4 दिन पहले · 1 बार देखा गया

NVIDIA ने स्वचालित ड्राइविंग के लिए 34B ओपन VLA मॉडल Alpamayo 2 Super जारी किया

NVIDIA ने OpenMDW-1.1 लाइसेंस के तहत रोबोटैक्स और स्वचालित ड्राइविंग के लिए डिज़ाइन किए गए 34-अरब पैरामीटर वाले विजन-लैंग्वेज-एक्शन (VLA) मॉडल Alpamayo 2 Super को जारी किया है। मॉडल मल्टी-कैमरा वीडियो से ट्रेजेक्टरी, कारण स्पष्टीकरण और मेटा-एक्शन उत्पन्न करने के लिए 32B Cosmos 3 Super Reasoner बैकबोन को 2.3B डिफ्यूजन-आधारित एक्शन डिकोडर के साथ जोड़कर लॉन्ग-टेल इवेंट्स पर ध्यान केंद्रित करता है।

arxiv arXiv cs.AI · 4 दिन पहले

Video-DeepResearch ने निरंतर वीडियो स्ट्रीम के लिए बहुआयामी एजेंट पेश किया

शोधकर्ताओं ने Video-DeepResearch (Video-DR) पेश किया है, जो स्थिर छवियों से निरंतर वीडियो स्ट्रीम तक बहुआयामी एजेंटों को विस्तारित करने वाला एक ढांचा है, जो मोडालिटी पूर्वाग्रह और पैरामीट्रिक ज्ञान लीक होने की समस्याओं को दूर करता है। सिस्टम क्रॉस-फ्रेमल दृश्य आधार को वेब पुनर्प्राप्ति से पहले लागू करने के लिए चरण-दर-चरण टूल अनलॉकिंग के साथ एक अलग संवेदन-अन्वेषण पाइपलाइन का उपयोग करता है।

lab Mistral AI News · 5 दिन पहले · 3 बार देखा गया

Shieldstral ने पॉलिसी-अनुकूलित 3B बहुमोडल सुरक्षा वर्गीकारक का परिचय दिया

Shieldstral एक 3B ओपन-वेट्स बहुमोडल सुरक्षा वर्गीकारक है जो सामग्री मॉडरेशन को एक पॉलिसी-अनुकूलित प्रश्न-उत्तर कार्य के रूप में परिभाषित करता है, जिससे इसे पुनः प्रशिक्षण के बिना निष्पादन समय पर साधारण भाषा की नीतियों को स्वीकार करने की क्षमता प्राप्त होती है। यह पाठ और छवि सुरक्षा मूल्यांकन को एकीकृत करता है और विभिन्न बेंचमार्क्स पर संतुलित सुरक्षा स्कोर प्रदान करते हुए एकल 16GB NVIDIA GPU पर कुशलता से चलता है।

arxiv arXiv cs.CL · 5 दिन पहले · 1 बार देखा गया

डौइयां ने शीर्ष प्रदर्शन वाले DME बहु-मोडल एम्बेडिंग मॉडल को जारी किया

डौइयां ने अपने मल्टीमोडल एम्बेडिंग (DME) मॉडल के लिए तकनीकी रिपोर्ट जारी की है, जो शक्तिशाली विभेदन और दक्षता प्राप्त करने के लिए बड़े पैमाने पर कंट्रास्टिव प्री-ट्रेनिंग को लेटेन्ट रीजनिंग के साथ जोड़ता है।

media r/LocalLLaMA · 5 दिन पहले

Qwen3.8-Max ने 35 प्रॉम्प्ट्स पर one-shot किया, जिसमें एक्वेरियम टूटने की सिमुलेशन भी शामिल है

लेख में Qwen3.8-Max के one-shot मूल्यांकन संदर्भ में इसके प्रदर्शन को हाइलाइट किया गया है, जो जटिल भौतिक सिमुलेशन को संभालने की इसकी क्षमता पर प्रकाश डालता है।

media r/LocalLLaMA · 6 दिन पहले · 1 बार देखा गया

MiniMax ने Hugging Face पर H3 ओमनीमोडल जनरेटिव सिस्टम जारी किया

MiniMax ने अपने MiniMax-H3 मॉडल को Hugging Face पर उपलब्ध कराया है। यह सामान्य-उद्देश्य, ओमनीमोडल जनरेटिव सिस्टम टेक्स्ट, इमेज, वीडियो और ऑडियो से मिले बहुआयामी संदर्भों के एकीकृत समर्थन को सपोर्ट करता है।

media MarkTechPost · 6 दिन पहले GPQA Diamond · 89.5% · 1 बार देखा गया

थिंकिंग मशीन्स लैब ने 276B ओपन वेट्स मल्टीमोडल MoE मॉडल इंकलिंग-स्माल रिलीज़ किया

थिंकिंग मशीन्स लैब ने इंकलिंग-स्माल रिलीज़ किया, जो 276 बिलियन कुल पैरामीटर और 12 बिलियन एक्टिव पैरामीटर वाला एक ओपन-वेट्स मिक्चर-ऑफ़-एक्सपर्ट्स मॉडल है। इस मॉडल को टेक्स्ट, छवियों और ऑडियो पर स्वदेशी रूप से तर्क करने के लिए प्रशिक्षित किया गया है, जिसमें 1M टोकन संदर्भ विंडो और समायोज्य सोचने की मेहनत शामिल है।

media Interconnects · 7 दिन पहले · 10 बार देखा गया

Thinking Machines ने Inkling जारी किया, Tencent ने Apache 2.0 लाइसेंस के साथ Hy3 को अपडेट किया

ओपन मॉडल आर्टिफैक्ट्स की ताज़ा समीक्षा में Thinking Machines और Tencent से महत्वपूर्ण रिलीज़ और Poolside तथा DeepSeek से अपडेट्स उभरकर सामने आए हैं।

media Hugging Face Forums · 7 दिन पहले

हाई स्कूल के छात्र ने AttnRoute-MoE Vision Transformer पेपर के लिए arXiv एंडोसर की खोज की

हान्यु (ओलिविया) यु, एक हाई स्कूल के दसवीं कक्षा की छात्रा, cs.LG या cs.CV में arXiv एंडोसर की तलाश में है ताकि वह अपना स्वतंत्र प्रीप्रिंट "AttnRoute-MoE: Attention-Prior Routing for Mixture-of-Experts Vision Transformers" अपलोड कर सके।

github llama.cpp · 8 दिन पहले · 3 बार देखा गया

llama.cpp b10218 में minicpmv46 downsample सपोर्ट जोड़ा गया

llama.cpp प्रोजेक्ट ने build b10218 जारी किया, जिसमें pull request #25993 के माध्यम से minicpmv46 downsample सपोर्ट की जोड़ शामिल है। इस अपडेट में एक 4x ignore VIT merger पेश किया गया है और downsample mode को GGUF फॉर्मेट के अंदर रखा गया है।

media AI News (smol.ai) · 9 दिन पहले · 2 बार देखा गया

OpenAI ने GPT-5.6 की कीमतें कम कीं, Thinking Machines ने Inkling-Small जारी किया, Google ने Gemini Robotics 2 लॉन्च किया

यह AI समाचार समीक्षा मूल्य निर्धारण, ओपन-वेट मॉडल और रोबोटिक्स इंफ्रास्ट्रक्चर में महत्वपूर्ण विकास को कवर करती है। OpenAI ने GPT-5.6 की लागत को aggressively कम किया जबकि Thinking Machines ने एक कॉम्पैक्ट मल्टीमोडल मॉडल जारी किया, और Google DeepMind ने अपनी रोबोटिक्स क्षमताओं का विस्तार किया।

media r/LocalLLaMA · 12 दिन पहले · 5 बार देखा गया

माइक्रोसॉफ्ट ने मैज-वीएल जारी किया, एक कोडेक-नेटिव स्ट्रीमिंग मल्टीमोडल मॉडल

माइक्रोसॉफ्ट ने मैज-वीएल जारी किया है, जो छवि और वीडियो समझ के लिए एक कुशल 4B-पैरामीटर मल्टीमोडल फाउंडेशन मॉडल है जो दृश्य प्रसंस्करण को सरल बनाने के लिए एक कोडेक-नेटिव दृष्टिकोण का उपयोग करता है। सिस्टम वीडियो स्ट्रीम को एंकर (I) फ्रेम और पूर्वानुमानित (P) फ्रेम में अलग करता है, केवल उन पैच को बनाए रखता है जहां कोडेक बिट्स आवंटित करता है, जिससे दृश्य टोकन की खपत 75% से अधिक कम हो जाती है।

lab NVIDIA Research · 12 दिन पहले · 8 बार देखा गया

NVIDIA ने मल्टीमोडल मॉडल के स्थानिक तर्क के लिए एक पदानुक्रमित निदान ढांचा Spatial-IQ का परिचय दिया

NVIDIA के शोधकर्ताओं ने Spatial-IQ का परिचय दिया है, जो मल्टीमोडल लार्ज लैंग्वेज मॉडल्स (MLLMs) की स्थानिक बुद्धिमत्ता को तोड़ने के लिए डिज़ाइन किया गया एक निदान ढांचा है। मौजूदा बेंचमार्क्स के विपरीत जो मॉडल्स को ब्लैक बॉक्स के रूप में मानते हैं, यह दृष्टिकोण स्टैक्ड 3D संरचनाओं में वस्तु गिनती को मानव विकास चरणों से सुसंगत नौ संवेदी और संज्ञानात्मक उप-कार्यों में विभाजित करता है।

arxiv arXiv cs.AI · 12 दिन पहले · 1 बार देखा गया

ClinFusion ने समग्र चिकित्सा समझ के लिए दृष्टि-केंद्रित MLLM का परिचय दिया

शोधकर्ताओं ने ClinFusion का परिचय दिया है, जो एक दृष्टि-केंद्रित बहुआयामी बड़े भाषा मॉडल है जिसे क्लिनिकल प्रैक्टिस में AI को तैनात करने की चुनौतियों को 2D और 3D चिकित्सा छवि समझ को एकीकृत करके संबोधित करने के लिए डिज़ाइन किया गया है। इस सिस्टम में एक संयोजक कैस्केडेड वीजन एन्कोडर Cascade Spatial-Aware Locality Fusion ऑपरेटर के साथ शामिल है और इसमें MedIF-Bench और क्षेत्र-की-दृष्टि-ग्राउंडेड मेट्रिक्स से मिलकर बना एक नया मूल्यांकन फ्रेमवर्क शामिल है।

arxiv arXiv cs.CL · 12 दिन पहले · 1 बार देखा गया

ClinFusion: दृष्टि-केंद्रित MMLM ने चिकित्सा मानदंडों में नई सर्वश्रेष्ठ प्रदर्शन स्थापित की

शोधकर्ताओं ने ClinFusion का परिचय दिया, जो एक दृष्टि-केंद्रित बहुमोडल बड़ी भाषा मॉडल है जो संपूर्ण चिकित्सा समझ के लिए डिज़ाइन किया गया है और 2D तथा प्राकृतिक 3D छवि विश्लेषण को एकत्र करता है। यह प्रणाली विषम चिकित्सा इमेजिंग की चुनौतियों को दूर करने के लिए Cascade Spatial-Aware Locality Fusion ऑपरेटर के साथ एक संयोजक कैस्केडेड विसन एन्कोडर का उपयोग करती है।

lab NVIDIA Research · 13 दिन पहले · 3 बार देखा गया

Delta Force में अकथित संचार का मल्टीमोडल AI विश्लेषण

शोधकर्ता प्रतिस्पर्धी शूटर गेम Delta Force के gameplay वीडियो का विश्लेषण कर रहे हैं ताकि उत्पन्न होने वाले अकथित संचार, जैसेgestures और movement patterns को निकाला और समझा जा सके। यह कार्य उन पूर्व अध्ययनों में एक अंतराल को दूर करता है जो मुख्य रूप से MOBA गेम्स या अन्य shooters में verbal coordination पर केंद्रित रहे हैं।

github llama.cpp · 13 दिन पहले · 3 बार देखा गया

llama.cpp b10142 में MiniMax-M3 विजन के लिए प्रारंभिक समर्थन जोड़ा गया

llama.cpp परियोजना ने बिल्ड b10142 जारी किया, जिसमें MiniMax-M3 मॉडल के लिए विजन का प्रारंभिक समर्थन शामिल है। यह अपडेट एक पाठ-केवल पोर्ट लागू करता है जो मौजूदा घटकों को पुन: उपयोग करता है, जिनमें GQA (प्रत्येक हेड QK-norm और आंशिक रोटरी के साथ), DeepSeek-V3 शैली के एक्सपर्ट्स, और swigluoai सक्रियण शामिल हैं।

media MarkTechPost · 13 दिन पहले · 1 बार देखा गया

ब्लैक फॉरेस्ट लैब्स ने FLUX 3 जारी किया, जो छवि, वीडियो, ऑडियो और रोबोट एक्शन भविष्यवाणी के लिए एक बहुआयामी फ्लो मॉडल है

ब्लैक फॉरेस्ट लैब्स ने FLUX 3 जारी किया है, जो छवियों, वीडियो और ऑडियो से एक ही आर्किटेक्चर में सीखने वाला एक बहुआयामी आधार मॉडल है। यह पहला FLUX मॉडल है जिसने एक ही सेट के वजन से वीडियो, ऑडियो और एक्शन भविष्यवाणी को शिप किया है।

media MarkTechPost · 14 दिन पहले · 2 बार देखा गया

इंडक्शन लैब्स ने फोटॉन-1 जारी किया, जो 18 साल के वीडियो पर प्रशिक्षित एक कल्पना मॉडल है

इंडक्शन लैब्स ने Photon-1 जारी किया है, जो एक विरल 106B-A5B मिक्सचर-ऑफ़-एक्सपर्ट्स ट्रान्सफॉर्मर है जो एक्शन लेबल्स के बिना कच्चे वीडियो से भविष्य के फ्रेम की भविष्यवाणी करके डेस्कटॉप वातावरणों का सिमुलेशन करने और गेम खेलना सीखता है। मॉडल प्रत्येक फ्रेम को 960 विविक्त टोकन में संकुचित करने के लिए परिमित स्केलर क्वांटीकरण का उपयोग करता है, मौजूदा प्रतिनिधित्वों की तुलना में पांच सौ गुना से अधिक बेहतर कंप्रेशन प्राप्त करते हुए भी टेक्स्ट और लेआउट विवरण को बनाए रखता है।

media r/LocalLLaMA · 16 दिन पहले · 1 बार देखा गया

FLUX 3 ने छवि, वीडियो, ऑडियो और एक्शन पूर्वानुमान के लिए एक बहुआयामी फ्लो मॉडल पेश किया है

FLUX 3 को छवि, वीडियो, ऑडियो और एक्शन-पूर्वानुमान कार्यों को संभालने के लिए डिज़ाइन किए गए एकल बहुआयामी मॉडल के रूप में पेश किया गया है। सिस्टम विभिन्न शैलियों में जीवन के अधिक नजदीक रचनाएं उत्पन्न करने का लक्ष्य रखता है।