Multimodal
arxiv arXiv cs.CL · 7 घंटे पहले · 11 बार देखा गया

Qwen ने Qwen3.8-Omni-Flash जारी किया, जो 1M टोकन संदर्भ के साथ एक स्थानीय बहुआयामी एजेंटिक मॉडल है

Alibaba Cloud ने Qwen3.8-Omni-Flash का परिचय दिया, जो एक स्वदेशी बहुआयामी एजेंटिक मॉडल है जो वास्तविक दुनिया की उत्पादकता कार्यों के लिए डिज़ाइन किया गया है और पिछले omni मॉडलों की तुलना में बहुआयमी समझ और तर्कशीलता को काफी बेहतर बनाता है।

media MarkTechPost · 3 दिन पहले · 18 बार देखा गया

अलibaba क्वेन टीम ने इंटरलीव आर्किटेक्चर के साथ Qwen3.8-LiveTranslate जारी किया

अलibaba क्वेन टीम ने Qwen3.8-LiveTranslate जारी किया है, जो एक अगली पीढ़ी का रियल-टाइम सिमुल्टेनस इंटर्प्रिटेशन मॉडल है जो लाइव स्पीच सुनता है और वक्ता अभी भी बोल रहा हो तभी अनुवादित टेक्स्ट और ऑडियो लौटाता है। इस रिलीज में लेटेंसी कम करने और अनुवाद गुणवत्ता को बेहतर बनाने के लिए डिज़ाइन किया गया एक नया इंटरलीव आर्किटेक्चर पेश किया गया है।

media r/LocalLLaMA · 5 दिन पहले · 36 बार देखा गया

inclusionAI ने Realtime-Venus जारी किया, एक 9B ऑडियो-विजुअल इंटरैक्शन मॉडल

inclusionAI ने Hugging Face पर Realtime-Venus सिस्टम जारी किया है, जिसमें दो चेकपॉइंट्स शामिल हैं: Realtime-Venus-Omni और Realtime-Venus-Audio। Omni चेकपॉइंट एक 9B ऑडियो-विजुअल इंटरैक्शन मॉडल है जो MiniCPM-o 4.5 से अनुकूलित किया गया है और लगातार देखता और सुनता रहता है ताकि यह तय कर सके कि कब प्रतिक्रिया देनी है।

media MarkTechPost · 5 दिन पहले · 24 बार देखा गया

अलibaba ने Qwen3.8-Omni-Flash जारी किया, जो एजेंटिक ओमनी-मोडल मॉडल है जिसमें 1M संदर्भ है

अलibaba की Qwen टीम ने Qwen3.8-Omni-Flash जारी किया है, जो ऑडियो-वीडियो समझ और टूल उपयोग के लिए एजेंटिक क्षमताओं के आसपास डिज़ाइन किया गया उनका पहला ओमनी-मोडल मॉडल है। मॉडल टेक्स्ट, छवियों, ऑडियो और वीडियो इनपुट स्वीकार करता है ताकि टेक्स्ट आउटपुट वापस ला सके, जिसमें 1M-टोकन संदर्भ विंडो और नेटिव फंक्शन कॉलिंग शामिल हैं।

arxiv arXiv cs.CL · 5 दिन पहले · 24 बार देखा गया

DeepSeek ने V4.1-Flash जारी की जिसमें KV कैश फुटप्रिंट 890 बाइट्स/टोकन है

DeepSeek ने DeepSeek-V4.1-Flash जारी किया है, जो एक बहुआयामी Mixture-of-Experts मॉडल है जिसे एजेंटिक वर्कलोड में लंबे संदर्भ की गणना और बड़े KV कैश के उच्च खर्च को दूर करने के लिए डिज़ाइन किया गया है।

lab Tencent Hunyuan (HF) · 6 दिन पहले · 23 बार देखा गया

टेंसेंट ने WeVisDoc-2B और WeVisDoc-4B दस्तावेज़ पार्सर जारी किए

टेंसेंट ने Qwen3-VL मॉडलों से फाइन-ट्यून किए गए पेज इमेज के लिए एक एंड-टू-एंड दस्तावेज़ पार्सर, WeVisDoc जारी किया है। सिस्टम पेज इमेज को संरचित Markdown में परिवर्तित करता है, जिसमें LaTeX सूत्र और HTML टेबल शामिल हैं।

lab Tencent Hunyuan (HF) · 6 दिन पहले · 64 बार देखा गया

Tencent ने WeVisDoc-4B जारी किया, एक एंड-टू-एंड दस्तावेज़ पार्सर

Tencent ने पेज इमेज के लिए एक एंड-टू-एंड दस्तावेज़ पार्सर WeVisDoc-4B जारी किया है जो पेजों को LaTeX सूत्रों और HTML तालिकाओं के साथ संरचित Markdown में परिवर्तित करता है। Qwen3-VL-4B-Instruct से फाइन-ट्यून किए गए, मॉडल ने OmniDocBench v1.6 पर 95.38 का समग्र स्कोर प्राप्त किया और सभी चार रिपोर्ट किए गए सेटिंग्स में तुलना किए गए पार्सर्स के बीच पहले स्थान पर है।

media r/LocalLLaMA · 10 दिन पहले · 20 बार देखा गया

वैज्ञानिक बुद्धिमत्ता के लिए InternLM ने वैज्ञानिक इंटर-एस2-397B बहुआयामी मॉडल जारी किया

इंटरएलएम ने वैज्ञानिक इंटर-एस2-397B का परिचय दिया है, जो वैज्ञानिक बुद्धिमत्ता और दीर्घकालिक एजेंट्स के लिए डिज़ाइन किया गया एक 397-अरब पैरामीटर वाला बहुआयामी फाउंडेशन मॉडल है। यह मॉडल सामान्य तर्कशक्ति और एजेंटिक क्षमताओं को बढ़ाने के लिए प्री-ट्रेनिंग, रीइन्फोर्समेंट-लर्निंग टास्क कवरेज और इंटरैक्टिव एजेंट वातावरण में स्केल करता है।

lab IBM Research (Granite) · 13 दिन पहले · 24 बार देखा गया

IBM और NASA ने NASA-IBM Lunar Foundation Model को ओपन-सोर्स किया

IBM और NASA ने NASA-IBM Lunar Foundation Model को ओपन-सोर्स कर दिया है, जो एक AI सिस्टम है जो अमेरिकी और जापानी मिशनों से डेटा के दशकों के मल्टीमोडल चंद्र डेटा को एक एकीकृत प्रतिनिधित्व में समेटता है। IBM की TerraMind आर्किटेक्चर पर बना, यह मॉडल जटिल प्रकाश और डेटा रिज़ॉल्यूशन जैसे चुनौतियों से निपटने के लिए विभिन्न स्केल और दृश्य कोणों पर अवलोकनों को एकीकृत करता है।

media r/LocalLLaMA · 13 दिन पहले · 21 बार देखा गया

DeepSeek ने V4-1 Flash जारी किया, जो 1M टोकन संदर्भ के साथ 552B MoE मॉडल है

DeepSeek ने अपना नया मॉडल DeepSeek V4-1 Flash जारी किया है। यह एक बहुआयामी Mixture-of-Experts (MoE) मॉडल है जिसमें 552 अरब पैरामीटर का बैकबोन है।

lab DeepSeek API Docs · 13 दिन पहले Codeforces (Elo) · 3471.0Elo · 51 बार देखा गया

DeepSeek ने मूल बहुआयामी समर्थन के साथ V4.1-Flash मॉडल जारी किया

DeepSeek ने आधिकारिक तौर पर DeepSeek-V4.1-Flash मॉडल जारी किया है, जो इसके नए आर्किटेक्चर परिवार का सबसे छोटा सदस्य है और जिसमें मूल बहुआयामी दृश्य समझ शामिल है। यह नया आर्किटेक्चर बड़े मॉडलों के लिए उच्चतर क्षमता छत, तेज़ इनफरेंस गति, उच्च थ्रूपुट और बेहतर स्केलिंग संभावना प्रदान करने के लिए डिज़ाइन किया गया है।

media r/LocalLLaMA · 15 दिन पहले · 35 बार देखा गया

inclusionAI ने Ling-3.0-flash-VL मल्टीमोडल मॉडल जारी किया

inclusionAI ने ओपन-सोर्स Ling-3.0-flash-VL मॉडल जारी किया है, जो अपनी पूर्ववर्ती की भाषा और तर्क क्षमताओं को प्राकृतिक छवि और वीडियो समझ के साथ बढ़ाता है।

media r/LocalLLaMA · 15 दिन पहले · 34 बार देखा गया

DeepSeek ने DeepSeek V4.1 Flash के लिए आंतरिक बीटा खोला है जिसमें नैटिव मल्टीमोडल समर्थन है

DeepSeek ने अपने DeepSeek V4.1 Flash मॉडल के एक मध्यवर्ती संस्करण के लिए आंतरिक बीटा परीक्षण खोल दिया है, जो अब API के माध्यम से उपलब्ध है।

media MarkTechPost · 18 दिन पहले · 33 बार देखा गया

गूगल ने जेमिनी फ्लैश मॉडल्स के लिए एजेंटिक वीडियो समझ शुरू की

गूगल ने अपने जेमिनी फ्लैश मॉडल्स में एजेंटिक वीडियो समझ को लॉन्च किया है, जिसने पिछली स्थिर प्रोसेसिंग विधि को उस सिस्टम से बदल दिया है जो वीडियो टाइमलाइन पर अनुरोध के अनुसार नेविगेट करता है। इस बदलाव से मॉडल यह तय कर सकता है कि क्या देखना है, किस फ्रेम रेट पर, और किस मोडैलिटी के माध्यम से, न कि एक निश्चित एक फ्रेम प्रति सेकंड की दर से पूरी टाइमलाइन को इनगेस्ट करना।

github llama.cpp · 19 दिन पहले · 62 बार देखा गया

llama.cpp 0.4.0 में Qwen3.8-Flash-Next और Nemotron-3-Puzzle का समर्थन जोड़ा गया

llama.cpp संस्करण 0.4.0 ने Qwen3.8-Flash-Next और NVIDIA Nemotron-3-Puzzle-75B-A9B मॉडलों के लिए प्रारंभिक आर्किटेक्चर समर्थन पेश किया है, साथ ही underlying ggml लाइब्रेरी को संस्करण 0.23.0 पर अपडेट किया गया है।

media r/LocalLLaMA · 19 दिन पहले · 39 बार देखा गया

Ling-3.0-flash-VL ने Ling-3.0-flash में दृश्य समझ और एजेंट क्षमताएं जोड़ी हैं

Ling-3.0-flash-VL एक नया मॉडल है जो Ling-3.0-flash आर्किटेक्चर पर बनाया गया है और जिसमें दृश्य समझ और दृश्य एजेंट क्षमताएं शामिल हैं।

arxiv arXiv cs.CL · 19 दिन पहले · 36 बार देखा गया

VisCAD ने बहुसंवाहक औद्योगिक CAD बुद्धिमत्ता के साथ फाउंडेशन मॉडल सूट जारी किया

शोधकर्ताओं ने VisCAD प्रस्तुत किया, जो एक फाउंडेशन मॉडल सूट है जिसे यथार्थवादी औद्योगिक उत्पाद डिजाइन के लिए व्यापक सामान्यीकरण और मजबूत क्षमता प्रदान करने के लिए डिज़ाइन किया गया है। यह सूट विभिन्न इनपुट जैसे रेंडर्स और टेक्स्ट से पार्ट-लेवल जनरेशन, साथ ही इंटरैक्टिंग पार्ट्स वाले असेंबली-लेवल जनरेशन की चुनौतियों को संबोधित करता है।

lab Hugging Face Blog · 20 दिन पहले · 34 बार देखा गया

NeoMME ने घने और देर-इंटरैक्शन रीट्रीवल के साथ कुशल बहुआयामी एन्कोडर जारी किए

शोधकर्ताओं ने NeoMME का परिचय दिया, जो 260M और 800M बहुभाषी बहुआयामी एन्कोडर्स का एक परिवार है जो एकल द्विदिशात्मक Transformer का उपयोग करके पाठ और कच्चे छवि पैचों को प्रोसेस करता है। जनरेटिव विज़ुअल लैंग्वेज मॉडल्स के विपरीत, NeoMME अलग-अलग प्रीट्रेन्डेड विज़न टावर या कैज़ुअल डिकोडर्स पर निर्भर नहीं करता है, और पूरे मॉडल को एक मास्क्ड डिस्क्रीट-डिफ्यूजन ऑब्जेक्टिव के साथ शून्य से प्रशिक्षित करता है।

github vLLM · 20 दिन पहले · 22 बार देखा गया

v0.29.0rc2, SHM वर्कर कैश में प्रीफ़िक्स-कवर्ड आइटम्स के लिए ठीक करता है

v0.29.0rc2 रिलीज़ में, SHM वर्कर कैश के लिए एक बगफ़िक्स शामिल है ताकि प्रीफ़िक्स-कवर्ड आइटम्स को उचित रूप से संभाला जा सके।