विषय · Multimodal
lab DeepSeek API Docs · 21 दिन पहले Codeforces (Elo) · 3471.0Elo · 67 बार देखा गया

DeepSeek ने मूल बहुआयामी समर्थन के साथ V4.1-Flash मॉडल जारी किया

DeepSeek ने आधिकारिक तौर पर DeepSeek-V4.1-Flash मॉडल जारी किया है, जो इसके नए आर्किटेक्चर परिवार का सबसे छोटा सदस्य है और जिसमें मूल बहुआयामी दृश्य समझ शामिल है। यह नया आर्किटेक्चर बड़े मॉडलों के लिए उच्चतर क्षमता छत, तेज़ इनफरेंस गति, उच्च थ्रूपुट और बेहतर स्केलिंग संभावना प्रदान करने के लिए डिज़ाइन किया गया है।

lab Microsoft Research Blog · 23 घंटे पहले · 3 बार देखा गया

माइक्रोसॉफ्ट रिसर्च ने क्वाइन पेश किया, बहुमोडल जैविक शोध के लिए एक एआई सिस्टम

माइक्रोसॉफ्ट रिसर्च ने क्वाइन का परिचय दिया, जो जीव विज्ञान का एक बहुमोडल विश्व मॉडल बनाने और मॉडलों, वैज्ञानिक उपकरणों, साहित्य और शोधकर्ताओं को जोड़ने वाले इंटरैक्टिव हैर्नेस को डिज़ाइन करने के लिए बनाया गया एक नया शोध प्रयास है। सिस्टम वैज्ञानिकों को प्रस्ताव तैयार करने की अनुमति देकर वास्तविक प्रयोगशाला वातावरण में परीक्षण किए जाने वाले और भविष्य के प्रश्नों को परिष्कृत करने के लिए परिणामों को वापस भेजने वाले, कंप्यूटेशनल मॉडलिंग और वास्तविक दुनिया के प्रयोग के बीच की खाई को पाटने का लक्ष्य रखता है।

lab Google DeepMind Blog · 6 दिन पहले · 15 बार देखा गया

गूगल ने नए रियल-टाइम विजुअल संवाद के लिए लाइव अवतार के साथ गेमिनी 3.8 Live का परिचय दिया

गूगल ने गेमिनी एंटरप्राइज़ के लिए मूल लाइव संवाद मॉडलों के लिए गतिशील विजुअल पर्सोना बनाने हेतु नए रियल-टाइम वीडियो जनरेशन और बोलचाल को जोड़ने वाली एक सुविधा, लाइव अवतार के साथ गेमिनी 3.8 Live का परिचय दिया है।

media MarkTechPost · 12 दिन पहले · 35 बार देखा गया

अलibaba ने Qwen3.8-Omni-Flash जारी किया, जो एजेंटिक ओमनी-मोडल मॉडल है जिसमें 1M संदर्भ है

अलibaba की Qwen टीम ने Qwen3.8-Omni-Flash जारी किया है, जो ऑडियो-वीडियो समझ और टूल उपयोग के लिए एजेंटिक क्षमताओं के आसपास डिज़ाइन किया गया उनका पहला ओमनी-मोडल मॉडल है। मॉडल टेक्स्ट, छवियों, ऑडियो और वीडियो इनपुट स्वीकार करता है ताकि टेक्स्ट आउटपुट वापस ला सके, जिसमें 1M-टोकन संदर्भ विंडो और नेटिव फंक्शन कॉलिंग शामिल हैं।

github vLLM · 27 दिन पहले · 29 बार देखा गया

v0.29.0rc2, SHM वर्कर कैश में प्रीफ़िक्स-कवर्ड आइटम्स के लिए ठीक करता है

v0.29.0rc2 रिलीज़ में, SHM वर्कर कैश के लिए एक बगफ़िक्स शामिल है ताकि प्रीफ़िक्स-कवर्ड आइटम्स को उचित रूप से संभाला जा सके।

github llama.cpp · 2 दिन पहले · 3 बार देखा गया

llama.cpp b11240 में /v1/embeddings के लिए टाइप्ड मल्टीमोडल इनपुट सपोर्ट जोड़ा गया

llama.cpp सर्वर अब /v1/embeddings एंडपॉइंट के लिए टाइप्ड कंटेंट (विजन, ऑडियो, वीडियो) इनपुट का समर्थन करता है। यह अपडेट ओपेनएआई-स्टाइल से बंद किए गए कंटेंट ऐरे को स्वीकार करके मल्टीमोडल एम्बेडिंग अनुरोधों को सक्षम बनाता है, जिससे टेक्स्ट और image_url हिस्सों को एक साथ प्रोसेस किया जा सकता है।

media Hugging Face Forums · 4 दिन पहले · 12 बार देखा गया

स्नातक छात्र दृश्य हस्तक्षेप को रोकने के लिए Qwen 2.5 Omni 3B में वास्तुकला परिवर्तन का प्रस्ताव देता है

Hugging Face फोरम पर एक स्नातक छात्र VAPO पेपर से अवधारणाओं को Qwen 2.5 Omni 3B मॉडल पर लागू करने के बारे में चर्चा कर रहा है ताकि स्लाइड संदर्भ के साथ ऑडियो ट्रांसक्रिप्शन के दौरान हॉल्युसिनेशन समस्याओं का समाधान किया जा सके।

media MarkTechPost · 5 दिन पहले · 15 बार देखा गया

Liquid AI ने LFM2.5-VL-3B-DSpark स्पेकुलेटिव ड्राफ्टर जारी किया, जो 3.13x तक तेज़ डिकोडिंग प्रदान करता है

Liquid AI ने अपने LFM2.5-VL-3B विजन-लैंग्वेज मॉडल के लिए एक प्रायोगिक स्पेकुलेटिव-डिकोडिंग ड्राफ्ट मॉडल, LFM2.5-VL-3B-DSpark जारी किया है। इस ड्राफ्टर में लगभग 280M पैरामीटर जोड़े गए हैं और मॉडल के आउटपुट वितरण को बदले बिना टोकन जनरेशन को तेज़ किया गया है।

lab Hugging Face Blog · 6 दिन पहले · 13 बार देखा गया

Liquid AI ने दृश्य-भाषा मॉडल निष्पादन को तेज़ करने के लिए LFM2.5-VL-DSpark जारी किया

Liquid AI ने LFM2.5-VL-3B दृश्य-भाषा मॉडल के लिए निष्पादन को तेज़ करने के लिए एक अनुमानित डिकोडिंग ड्राफ्टर, LFM2.5-VL-DSpark ड्राफ्ट मॉडल जारी किया है। ड्राफ्टर उम्मीदवार टोकन उत्पन्न करने के लिए लक्ष्य मॉडल के स्थिर परतों से छिपी अवस्थाओं को पकड़ता है, जिसमें केवल 280M पैरामीटर (8.9% ओवरहेड) जुड़े हैं जबकि सभी मोडेलिटीज़ में समान आयाम बनाए रखे गए हैं।

lab Liquid AI · 6 दिन पहले · 8 बार देखा गया

Liquid AI ने LFM2.5-VL-3B के लिए DSpark ड्राफ्ट मॉडल जारी किया

Liquid AI ने अपने विजन-लैंग्वेज मॉडल LFM2.5-VL-3B के लिए एक प्रायोगिक DSpark ड्राफ्ट मॉडल जारी किया है, जो आउटपुट गुणवत्ता को बदले बिना एज डिवाइसों और GPU पर तेज़ डिकोडिंग सक्षम करता है।

media r/LocalLLaMA · 7 दिन पहले · 43 बार देखा गया

Apple ने LensVLM-9B जारी किया, एक VLM जो संपीड़ित पाठ छवियों का चयनात्मक रूप से विस्तार करता है

Apple ने LensVLM-9B जारी किया है, जो 9 अरब पैरामीटर वाला एक Vision Language Model है जिसे पाठ की संपीड़ित छवियों को अधिक कुशलता से प्रसंस्कृत करने के लिए डिज़ाइन किया गया है। मॉडल इन संपीड़ित इनपुट्स को स्कैन करता है और सीखे गए टूल्स का उपयोग करके केवल प्रासंगिक पृष्ठों को उनके अविस्तारित रूप में चयनात्मक रूप से विस्तारित करता है।

arxiv arXiv cs.CL · 8 दिन पहले · 19 बार देखा गया

Qwen ने Qwen3.8-Omni-Flash जारी किया, जो 1M टोकन संदर्भ के साथ एक स्थानीय बहुआयामी एजेंटिक मॉडल है

Alibaba Cloud ने Qwen3.8-Omni-Flash का परिचय दिया, जो एक स्वदेशी बहुआयामी एजेंटिक मॉडल है जो वास्तविक दुनिया की उत्पादकता कार्यों के लिए डिज़ाइन किया गया है और पिछले omni मॉडलों की तुलना में बहुआयमी समझ और तर्कशीलता को काफी बेहतर बनाता है।

media MarkTechPost · 10 दिन पहले · 28 बार देखा गया

अलibaba क्वेन टीम ने इंटरलीव आर्किटेक्चर के साथ Qwen3.8-LiveTranslate जारी किया

अलibaba क्वेन टीम ने Qwen3.8-LiveTranslate जारी किया है, जो एक अगली पीढ़ी का रियल-टाइम सिमुल्टेनस इंटर्प्रिटेशन मॉडल है जो लाइव स्पीच सुनता है और वक्ता अभी भी बोल रहा हो तभी अनुवादित टेक्स्ट और ऑडियो लौटाता है। इस रिलीज में लेटेंसी कम करने और अनुवाद गुणवत्ता को बेहतर बनाने के लिए डिज़ाइन किया गया एक नया इंटरलीव आर्किटेक्चर पेश किया गया है।

media r/LocalLLaMA · 12 दिन पहले · 55 बार देखा गया

inclusionAI ने Realtime-Venus जारी किया, एक 9B ऑडियो-विजुअल इंटरैक्शन मॉडल

inclusionAI ने Hugging Face पर Realtime-Venus सिस्टम जारी किया है, जिसमें दो चेकपॉइंट्स शामिल हैं: Realtime-Venus-Omni और Realtime-Venus-Audio। Omni चेकपॉइंट एक 9B ऑडियो-विजुअल इंटरैक्शन मॉडल है जो MiniCPM-o 4.5 से अनुकूलित किया गया है और लगातार देखता और सुनता रहता है ताकि यह तय कर सके कि कब प्रतिक्रिया देनी है।

arxiv arXiv cs.CL · 13 दिन पहले · 32 बार देखा गया

DeepSeek ने V4.1-Flash जारी की जिसमें KV कैश फुटप्रिंट 890 बाइट्स/टोकन है

DeepSeek ने DeepSeek-V4.1-Flash जारी किया है, जो एक बहुआयामी Mixture-of-Experts मॉडल है जिसे एजेंटिक वर्कलोड में लंबे संदर्भ की गणना और बड़े KV कैश के उच्च खर्च को दूर करने के लिए डिज़ाइन किया गया है।

lab Tencent Hunyuan (HF) · 13 दिन पहले · 40 बार देखा गया

टेंसेंट ने WeVisDoc-2B और WeVisDoc-4B दस्तावेज़ पार्सर जारी किए

टेंसेंट ने Qwen3-VL मॉडलों से फाइन-ट्यून किए गए पेज इमेज के लिए एक एंड-टू-एंड दस्तावेज़ पार्सर, WeVisDoc जारी किया है। सिस्टम पेज इमेज को संरचित Markdown में परिवर्तित करता है, जिसमें LaTeX सूत्र और HTML टेबल शामिल हैं।

lab Tencent Hunyuan (HF) · 13 दिन पहले · 78 बार देखा गया

Tencent ने WeVisDoc-4B जारी किया, एक एंड-टू-एंड दस्तावेज़ पार्सर

Tencent ने पेज इमेज के लिए एक एंड-टू-एंड दस्तावेज़ पार्सर WeVisDoc-4B जारी किया है जो पेजों को LaTeX सूत्रों और HTML तालिकाओं के साथ संरचित Markdown में परिवर्तित करता है। Qwen3-VL-4B-Instruct से फाइन-ट्यून किए गए, मॉडल ने OmniDocBench v1.6 पर 95.38 का समग्र स्कोर प्राप्त किया और सभी चार रिपोर्ट किए गए सेटिंग्स में तुलना किए गए पार्सर्स के बीच पहले स्थान पर है।

media r/LocalLLaMA · 17 दिन पहले · 25 बार देखा गया

वैज्ञानिक बुद्धिमत्ता के लिए InternLM ने वैज्ञानिक इंटर-एस2-397B बहुआयामी मॉडल जारी किया

इंटरएलएम ने वैज्ञानिक इंटर-एस2-397B का परिचय दिया है, जो वैज्ञानिक बुद्धिमत्ता और दीर्घकालिक एजेंट्स के लिए डिज़ाइन किया गया एक 397-अरब पैरामीटर वाला बहुआयामी फाउंडेशन मॉडल है। यह मॉडल सामान्य तर्कशक्ति और एजेंटिक क्षमताओं को बढ़ाने के लिए प्री-ट्रेनिंग, रीइन्फोर्समेंट-लर्निंग टास्क कवरेज और इंटरैक्टिव एजेंट वातावरण में स्केल करता है।

lab IBM Research (Granite) · 20 दिन पहले · 25 बार देखा गया

IBM और NASA ने NASA-IBM Lunar Foundation Model को ओपन-सोर्स किया

IBM और NASA ने NASA-IBM Lunar Foundation Model को ओपन-सोर्स कर दिया है, जो एक AI सिस्टम है जो अमेरिकी और जापानी मिशनों से डेटा के दशकों के मल्टीमोडल चंद्र डेटा को एक एकीकृत प्रतिनिधित्व में समेटता है। IBM की TerraMind आर्किटेक्चर पर बना, यह मॉडल जटिल प्रकाश और डेटा रिज़ॉल्यूशन जैसे चुनौतियों से निपटने के लिए विभिन्न स्केल और दृश्य कोणों पर अवलोकनों को एकीकृत करता है।