विषय · Multimodal
lab Google DeepMind Blog · 2 दिन पहले · 13 बार देखा गया

Google DeepMind ने Gboard और Live Transcribe के लिए SL2T साइन-लैंग्वेज-टू-टेक्स्ट मॉडल जारी किया

Google DeepMind और Android ने SL2T पेश किया, एक अत्यधिक बहुभाषी साइन-लैंग्वेज-टू-टेक्स्ट (SL2T) अनुवाद मॉडल जो पहली बार उपभोक्ता उत्पादों में साइन लैंग्वेज AI लाता है। यह तकनीक Pixel 11 पर Gboard और Live Transcribe में साइन-टू-टेक्स्ट डिक्टेशन को संचालित करती है, जिसमें अमेरिकी साइन लैंग्वेज (ASL) से अंग्रेजी शुरू होती है।

lab Google — The Keyword (AI) · 3 दिन पहले · 40 बार देखा गया

Google ने AMIE के साथ रियल-टाइम क्लिनिकल वीडियो परामर्श क्षमताओं का प्रदर्शन किया

Google Research और Google DeepMind ने अपने शोध मेडिकल AI सिस्टम, AMIE को आगे बढ़ाया है ताकि एक पहली बार के अध्ययन में रियल-टाइम क्लिनिकल वीडियो परामर्श क्षमताओं का प्रदर्शन किया जा सके। Gemini और Project Astra पर बहु-एजेंट आर्किटेक्चर का उपयोग करके बनाया गया, सिस्टम दृश्य और श्रव्य संकेतों की व्याख्या करता है, वर्चुअल शारीरिक परीक्षणों को निर्देशित करता है, और रियल-टाइम में निदानात्मक तर्क देता है।

lab Microsoft Research Blog · 2 दिन पहले · 23 बार देखा गया

माइक्रोसॉफ्ट रिसर्च ने VLMs की स्थानिक तर्कशक्ति का मूल्यांकन करने के लिए MindTopo बेंचमार्क पेश किया

माइक्रोसॉफ्ट रिसर्च ने MindTopo पेश किया है, एक नया बेंचमार्क जो इस बात का मूल्यांकन करने के लिए डिज़ाइन किया गया है कि क्या बहुआयामी बड़े भाषण मॉडल (multimodal large language models) कनेक्टिविटी, एन्क्लोजर, ऑर्डर, सेपरेशन और नॉट्स के संबंध में टोपोलॉजिकल अंतर्ज्ञान रखते हैं।

lab Microsoft Research Blog · 3 दिन पहले · 11 बार देखा गया

माइक्रोसॉफ्ट रिसर्च ने CARE-X पेश किया, एक एकीकृत छाती की एक्स-रे VLM जिसमें सहायक निगरानी और उपकरण-संवर्धित माप शामिल हैं

माइक्रोसॉफ्ट रिसर्च ने CARE-X का परिचय दिया है, जो एक शोध मॉडल है जिसे वर्तमान रेडियोलॉजी विज़न-लैंग्वेज मॉडल्स में अंतराल को दूर करने के लिए जनरेटिव रिपोर्ट लेखन और कैलिब्रेटेड निदान भविष्यवाणियों को जोड़कर डिज़ाइन किया गया है। सिस्टम क्लिनिकल सटीकता को पुरस्कृत करने के लिए रीइन्फोर्समेंट लर्निंग (DAPO) का उपयोग करता है और Qwen3-VL-4B-Instruct मॉडल को निर्धारक माप उपकरणों के साथ जोड़ता है ताकि सटीक गणनाओं की आवश्यकता वाली स्थितियों पर प्रदर्शन का आकलन किया जा सके।

lab NVIDIA Research · 4 दिन पहले · 3 बार देखा गया

GenRecal पुनः कैलिब्रेशन के माध्यम से बड़े विज़न-लैंग्वेज मॉडलों को छोटे मॉडलों में डिस्टिल करता है

शोधकर्ताओं ने GenRecal प्रस्तुत किया, एक सामान्य उद्देश्य वाला डिस्टिलेशन फ्रेमवर्क जो बड़े विज़न-लैंग्वेज मॉडलों (VLMs) से ज्ञान को छोटे और अधिक कुशल प्रतिरूपों में स्थानांतरित करता है। यह विधि एक Recalibrator का उपयोग करके विभिन्न प्रकार के मॉडलों के बीच फीचर प्रतिनिधित्वों को संरेखित और अनुकूलित करके विषम VLM आर्किटेक्चर की चुनौती को संबोधित करता है।

lab NVIDIA Research · 4 दिन पहले

Hide to See ने VLM डिस्टिलेशन के लिए तर्क-पूर्वअक्षर मास्किंग पेश की

शोधकर्ताओं ने एक नया सोच-जवाब डिस्टिलेशन फ्रेमवर्क प्रस्तावित किया है जो संपादित दृश्य-भाषा मॉडल की दृश्य साक्ष्य का उपयोग करने की क्षमता को महत्वपूर्ण तर्क-पूर्वअक्षरों को मास्क करके सुधारता है। यह दृष्टिकोण लंबे सोच-जवाब ट्रैकों में सामान्य "दृश्य भूल" समस्या को संबोधित करता है, जहां छात्र विस्तृत तर्क के दौरान दृश्य संकेतों पर ध्यान खो देते हैं।

lab NVIDIA Research · 18 दिन पहले · 9 बार देखा गया

NVIDIA ने मल्टीमोडल मॉडल के स्थानिक तर्क के लिए एक पदानुक्रमित निदान ढांचा Spatial-IQ का परिचय दिया

NVIDIA के शोधकर्ताओं ने Spatial-IQ का परिचय दिया है, जो मल्टीमोडल लार्ज लैंग्वेज मॉडल्स (MLLMs) की स्थानिक बुद्धिमत्ता को तोड़ने के लिए डिज़ाइन किया गया एक निदान ढांचा है। मौजूदा बेंचमार्क्स के विपरीत जो मॉडल्स को ब्लैक बॉक्स के रूप में मानते हैं, यह दृष्टिकोण स्टैक्ड 3D संरचनाओं में वस्तु गिनती को मानव विकास चरणों से सुसंगत नौ संवेदी और संज्ञानात्मक उप-कार्यों में विभाजित करता है।

lab NVIDIA Research · 18 दिन पहले · 7 बार देखा गया

Delta Force में अकथित संचार का मल्टीमोडल AI विश्लेषण

शोधकर्ता प्रतिस्पर्धी शूटर गेम Delta Force के gameplay वीडियो का विश्लेषण कर रहे हैं ताकि उत्पन्न होने वाले अकथित संचार, जैसेgestures और movement patterns को निकाला और समझा जा सके। यह कार्य उन पूर्व अध्ययनों में एक अंतराल को दूर करता है जो मुख्य रूप से MOBA गेम्स या अन्य shooters में verbal coordination पर केंद्रित रहे हैं।

lab Google — The Keyword (AI) · 23 दिन पहले · 1 बार देखा गया

गूगल गेमिनी इंटेलिजेंस टास्क ऑटोमेशन का विस्तार करता है और नोटबुक को गैलेक्सी डिवाइसों पर लाता है

गैलेक्सी अनपैक्ड 2026 में, गूगल ने नए सैमसंग गैलेक्सी Z Fold8 Ultra, Fold8, और Flip8 के लिए तीन अपडेट की घोषणा की, जो गेमिनी इंटेलिजेंस के रोलआउट पर केंद्रित हैं। कंपनी अपनी टास्क ऑटोमेशन क्षमताओं का विस्तार कर रही है ताकि 40 से अधिक लोकप्रिय ऐप्स का समर्थन किया जा सके, और इन डिवाइसों पर सीधे गेमिनी नोटबुक ऐप पेश कर रही है।

lab Hugging Face Blog · 5 दिन पहले · 3 बार देखा गया

मेटा ने ओपन सोर्स मल्टीमोडल मॉडल Muse Glimmer 30B जारी किया

मेटा ने Muse Glimmer जारी किया है, जो Hugging Face Hub पर ओपन सोर्स के रूप में उपलब्ध एक घना 30B पैरामीटर वाला मल्टीमोडल मॉडल है। आर्किटेक्चर में 28B टेक्स्ट डिकोडर और विजन टास्क के लिए 2B ViT-शैली Perception Encoder शामिल हैं।

lab Mistral AI News · 10 दिन पहले · 4 बार देखा गया

Shieldstral ने पॉलिसी-अनुकूलित 3B बहुमोडल सुरक्षा वर्गीकारक का परिचय दिया

Shieldstral एक 3B ओपन-वेट्स बहुमोडल सुरक्षा वर्गीकारक है जो सामग्री मॉडरेशन को एक पॉलिसी-अनुकूलित प्रश्न-उत्तर कार्य के रूप में परिभाषित करता है, जिससे इसे पुनः प्रशिक्षण के बिना निष्पादन समय पर साधारण भाषा की नीतियों को स्वीकार करने की क्षमता प्राप्त होती है। यह पाठ और छवि सुरक्षा मूल्यांकन को एकीकृत करता है और विभिन्न बेंचमार्क्स पर संतुलित सुरक्षा स्कोर प्रदान करते हुए एकल 16GB NVIDIA GPU पर कुशलता से चलता है।

media MarkTechPost · 26 दिन पहले · 7 बार देखा गया

अलीबाबा ने 2.4T-पैरामीटर वाला बहुआयामी मॉडल Qwen3.8-Max का प्रीव्यू दिया

19 जुलाई को, अलीबाबा की Qwen टीम ने 2.4 ट्रिलियन पैरामीटरों वाले एक नए फ्लैगशिप बहुआयामी मॉडल Qwen3.8-Max-Preview का प्रीव्यू दिया। यह घोषणा शंघाई में विश्व AI सम्मेलन के दौरान की गई, जो Moonshot AI द्वारा अपने Kimi K3 मॉडल को जारी करने के दो दिन बाद आई।

arxiv arXiv cs.LG · 18 घंटे पहले · 2 बार देखा गया

Intern-S2-Preview: वैज्ञानिक एजेंटिक फाउंडेशन मॉडल

लेखकों ने Intern-S2-Preview प्रस्तुत किया है, जो बहुआयामी वैज्ञानिक समझ, तर्कशक्ति, उत्पादन और दीर्घकालिक कार्यों का समर्थन करने के लिए डिज़ाइन किए गए वैज्ञानिक एजेंटिक फाउंडेशन मॉडलों की एक श्रृंखला है। प्रशिक्षण पाइपलाइन रेंडर किए गए वैज्ञानिक दस्तावेज़ों, अंतर्भेदित छवि-पाठ डेटा और विविध वैज्ञानिक संकलनों पर वैज्ञानिक बहुआयामी पूर्व-प्रशिक्षण के साथ शुरू होती है।

media r/LocalLLaMA · 1 दिन पहले

dots-studio ने 280B MoE मॉडल dots3-note preview जारी किया

dots-studio ने अपने dots3 परिवार का पहला ओपन-वेट मॉडल जारी किया है, जिसका नाम dots3-note preview है। यह Mixture-of-Experts मॉडल 280B कुल पैरामीटर के साथ 16B सक्रिय और 512K टोकन तक के संदर्भ का समर्थन करता है।

media MarkTechPost · 1 दिन पहले IFEval · 82.3% · 1 बार देखा गया

Liquid AI ने LFM2.5-VL-3B जारी किया, जो टूल कॉलिंग के साथ एक 3B ऑन-डिवाइज विजन-लैंग्वेज मॉडल है

Liquid AI ने LFM2.5-VL-3B जारी किया है, जो कुशल ऑन-डिवाइज तैनाती के लिए डिज़ाइन किया गया एक 3.1B-पैरामीटर विजन-लैंग्वेज मॉडल है। यह मॉडल मोबाइल, वेब और डेस्कटॉप वातावरण में डिजिटल स्क्रीन को पढ़ता है, वस्तुओं को निर्देशांक से जोड़ता है, दस्तावेज़ों को पार्स करता है, और टेक्स्ट या इमेज इनपुट से टूल कॉल निष्पादित करता है।

arxiv arXiv cs.AI · 2 दिन पहले · 3 बार देखा गया

SCOUT संरचित CoT और प्रक्रिया-सुपरवाइज्ड RL के माध्यम से VLMs में स्थानिक तर्कशक्ति को बेहतर बनाता है

शोधकर्ताओं ने SCOUT का प्रस्ताव रखा है, एक फ्रेमवर्क जो संरचित चेन-ऑफ़-थॉट (Chain-of-Thought) को बहु-उद्देश्यीय प्रक्रिया-पुरस्कार पुनर्बल सीखने (multi-objective process-reward reinforcement learning) के साथ मिलाकर विज़न-लैंग्वेज मॉडल्स की स्थानिक तर्कशक्ति को बढ़ाता है। यह दृष्टिकोण मौजूदा RL तरीकों में क्रेडिट असाइनमेंट की समस्याओं को हल करता है और व्यापक 3D समझ के लिए गहराई का अनुभव (depth perception) एकीकृत करता है।

lab Hugging Face Blog · 2 दिन पहले · 14 बार देखा गया

लिक्विड एआई ने तेज एज विज़न क्षमताओं के लिए LFM2.5-VL-3B जारी किया

लिक्विड एआई ने LFM2.5-VL-3B जारी किया है, जो एक 3-बिलियन पैरामीटर वाला विज़न-लैंग्वेज मॉडल है जिसे एज डिवाइसों पर बेहतर और तेज प्रदर्शन प्रदान करने के लिए डिज़ाइन किया गया है। यह मॉडल एक SigLIP2 400M NaFlex विज़न एन्कोडर को अपने टेक्स्ट-केवल समकक्ष की बैकबोन के साथ जोड़ता है, जिसका प्रशिक्षण लगभग 34 ट्रिलियन टोकन पर किया गया है, जिसमें पिछली रिलीजों की तुलना में चार गुना अधिक विज़न डेटा शामिल है।

lab Liquid AI · 2 दिन पहले Berkeley Function-Calling Leaderboard · 32.5% · 15 बार देखा गया

LFM2.5-VL-3B एज डिप्लॉयमेंट के लिए स्क्रीन समझ और फंक्शन कॉलिंग में सुधार करता है

LFM2.5-VL-3B एक नया विजन-लैंग्वेज मॉडल है जो रियल-टाइम और ऑन-डिवाइस एप्लिकेशन के लिए कम लेटेंसी बनाए रखते हुए बड़े मॉडल्स के मुकाबले प्रतिस्पर्धी प्रदर्शन प्रदान करता है। यह पिछले LFM2-VL-3B रिलीज पर स्क्रीन समझ, ग्रौंडिंग, फंक्शन कॉलिंग और मल्टी-इमेज इनपुट क्षमताओं में महत्वपूर्ण सुधारों के साथ आधारित है।

arxiv arXiv cs.AI · 4 दिन पहले

AMIE (Video) वास्तविक समय चिकित्सा परामर्शों में विशेषज्ञ-स्तर का प्रदर्शन प्राप्त करता है

शोधकर्ताओं ने AMIE (Video) का उपयोग करके वास्तविक समय की क्लिनिकल वीडियो परामर्शों के लिए पहला विशेषज्ञ-स्तरीय AI सिस्टम प्रदर्शित किया, जो एक Gemini-आधारित मल्टी-एजेंट सिस्टम है जो कम लेटेंसी संवाद को वास्तविक समय ऑडियो-विज़ुअल एड感知 के साथ एकीकृत करता है। 30 प्राथमिक देखभाल चिकित्सकों और 100 परिदृश्यों वाले एक यादृच्छिक उद्देश्य संरचित क्लिनिकल परीक्षण अध्ययन में, क्लिनिकल मूल्यांकनकर्ताओं ने सिस्टम का इतिहास लेने, निदान, प्रबंधन और शारीरिक अवलोकन में चिकित्सकों के बराबर या बेहतर रेटिंग दी।

arxiv arXiv cs.CL · 4 दिन पहले

AMIE (Video) वास्तविक समय में चिकित्सा परामर्शों में विशेषज्ञ-स्तर का प्रदर्शन प्राप्त करता है

शोधकर्ताओं ने AMIE (Video) का उपयोग करके वास्तविक समय की क्लिनिकल वीडियो परामर्शों के लिए पहला विशेषज्ञ-स्तरीय AI सिस्टम प्रदर्शित किया, जो एक Gemini-आधारित मल्टी-एजेंट सिस्टम है जो कम लेटेंसी संवाद को वास्तविक समय ऑडियो-विज़ुअल धारणा के साथ एकीकृत करता है।