स्रोत · NVIDIA Research
lab NVIDIA Research · 17 घंटे पहले · 7 बार देखा गया

Symphony पदानुक्रमित विषम प्रसंस्करण के साथ विरल और सघन टेंसर का संचालन करता है

लेख में Symphony का प्रस्ताव दिया गया है, जो एक मिश्रित प्रोग्राम करने योग्य और विशेषज्ञ आर्किटेक्चर है जिसे GPUs जैसी वर्तमान उच्च-प्रदर्शन आर्किटेक्चर में मेमोरी सिस्टम की अक्षमताओं को दूर करने के लिए डिज़ाइन किया गया है। यह आवश्यक डेटा गतिविधि और दूरी को कम करने के लिए मेमोरी पदानुक्रम भर में डेटा का संचालन पर केंद्रित है।

lab NVIDIA Research · 6 दिन पहले · 23 बार देखा गया

HorizonRelight लंबी अवधि के वीडियो रिलाइटिंग के लिए मस्क्ड सेल्फ-कंडीशनिंग का उपयोग करता है

शोधकर्ताओं ने कार्य को समय-शर्तित लैटेंट डोमेन अनुवाद के रूप में फिर से परिभाषित करके लंबी अवधि के वीडियो रिलाइटिंग में कालिक असंततताओं को संबोधित किया। फ्रेमवर्क सीमाओं पर लक्ष्य-डोमेन लैटेंट को प्रसारित करके क्रॉस-चंक निरंतरता को लागू करता है और इस व्यवहार को सीखने योग्य बनाने के लिए मस्क्ड लक्ष्य-डोमेन सेल्फ-कंडीशनिंग का उपयोग करता है।

lab NVIDIA Research · 6 दिन पहले · 28 बार देखा गया

Nvidia ने हाइब्रिड डोमेन नॉलेज फ्यूजन के माध्यम से रियल-टाइम पोर्ट्रेट रिलिटिंग के लिए FusionRelight प्रस्तुत किया

Nvidia के शोधकर्ताओं ने FusionRelight पेश किया है, जो एक विधि है जो भौतिक रूप से युक्तिसंगत प्रकाश स्थानांतरण को पहचान संरक्षण और संपीड़ित रियल-टाइम इनफरेंस के साथ जोड़ती है। यह दृष्टिकोण हाइब्रिड डोमेन नॉलेज फ्यूजन (HDKF) का उपयोग करता है, एक प्रशिक्षण ढांचा जो सिंथेटिक, वन-लाइट-एट-ए-टाइम (OLAT), और इन-द-वाइल्ड डेटा से भौतिकी, प्रतिबिंब और यथार्थता के पूर्वज्ञान को एक छात्र मॉडल में संक्षिप्त करता है।

lab NVIDIA Research · 9 दिन पहले · 61 बार देखा गया

LLM हाइपरपैरामीटर ऑप्टिमाइज़ेशन में बेयसियन ऑप्टिमाइज़ेशन के बराबर या बेहतर हैं

एक नई शोध पत्र मौलिक बड़े भाषा मॉडलों (LLM) का उपयोग हाइपरपैरामीटर ऑप्टिमाइज़ेशन (HPO) को स्वचालित करने के लिए करता है, जो एक प्रक्रिया है जो आमतौर पर सीमित-बजट सेटिंग्स में मानव दृष्टिकोणों पर निर्भर करती है। लेखकों ने एक विधि विकसित की जहाँ LLM डेटासेट और मॉडल के विवरण के आधार पर हाइपरपैरामीटर कॉन्फ़िगरेशन सुझाते हैं, जिन्हें मॉडल के प्रदर्शन के अनुसार पुनः परिष्कृत किया जाता है।

lab NVIDIA Research · 9 दिन पहले · 56 बार देखा गया

स्रोत प्रशिक्षण डेटा एट्रिब्यूशन के लिए अनुमानित अनरोल्ड डिफरेंशिएशन पेश करता है

शोधकर्ताओं ने स्रोत पेश किया, जो एक नया प्रशिक्षण डेटा एट्रिब्यूशन (TDA) विधि है जो प्रभाव फलनों की कंप्यूटेशनल दक्षता को अनरोलिंग-आधारित दृष्टिकोणों की सटीकता के साथ जोड़ती है। प्रभाव-फलन जैसी सूत्र का उपयोग करके अनरोल्ड डिफरेंशिएशन को अनुमानित करने द्वारा, स्रोत अंतर्निहित डिफरेंशिएशन विधियों में सीमाओं को दूर करता है, जैसे कि उनका ऑप्टिमाइजेशन बायस या बहु-चरण पाइलाइन को ध्यान में न रखना।

lab NVIDIA Research · 9 दिन पहले · 34 बार देखा गया

स्वचालित वाहन सिमुलेशन के लिए NVIDIA ने OmniDreams रियल-टाइम जनरेटिव वर्ल्ड मॉडल जारी किया

NVIDIA ने OmniDreams का परिचय दिया, जो एक फाउंडेशन जनरेटिव वर्ल्ड मॉडल है जिसे बंद-लूप सिमुलेशन में स्वचालित ड्राइविंग पॉलिसी के मूल्यांकन में आने वाली बाधाओं को दूर करने के लिए डिज़ाइन किया गया है। Cosmos diffusion मॉडल पर 21k घंटे के ड्राइविंग परिदृश्यों से मिड- और पोस्ट-ट्रेन किए जाने के बाद, यह रियल-टाइम में एक्शन-कंडीश्न्ड वीडियो ऑटोरेग्रेसिवली जनरेट करता है।

lab NVIDIA Research · 9 दिन पहले · 25 बार देखा गया

JacNet संरचित जैकोबियन को सीधे मॉडल करके फ़ंक्शंस सीखता है

पत्र में JacNet का परिचय दिया गया है, जो एक तंत्रिका नेटवर्क आर्किटेक्चर है जो इनपुट-आउटपुट फ़ंक्शन के जैकोबियन को सीधे सीखता है, न कि मैपिंग को। यह दृष्टिकोण अवकलज गुणों पर सटीक नियंत्रण की अनुमति देता है, जिससे व्युत्क्रमणीयता और k-Lipschitz निरंतरता जैसे संरचनात्मक पूर्वज्ञान को लागू करने की सुविधा मिलती है।

lab NVIDIA Research · 9 दिन पहले · 31 बार देखा गया

jlorraine गहन शिक्षण के लिए स्केलेबल नेस्टेड ऑप्टिमाइजेशन टूल्स प्रस्तुत करता है

लेख में jlorraine द्वारा एक शोधपत्र का परिचय दिया गया है जो बड़े-पैमाने पर गहन शिक्षण सेटअप में बाइलेवल या नेस्टेड ऑप्टिमाइजेशन लागू करने की चुनौतियों को संबोधित करता है। जबकि ग्रेडिएंट-आधारित ऑप्टिमाइजेशन आमतौर पर पैरामीटर के एक सेट को अपडेट करता है, कई अनुप्रयोगों में एक-दूसरे के अंदर नेस्टेड विभिन्न उद्देश्यों पर पैरामीटर के उपसमुच्चयों को अपडेट करने की आवश्यकता होती है।

lab NVIDIA Research · 10 दिन पहले · 30 बार देखा गया

Masters मास्किंग टीचर और स्टूडेंट को रिइन्फोर्सिंग के जरिए विजन-लैंग्वेज मॉडल्स को डिस्टिल करता है

शोधकर्ताओं ने Masters प्रस्तावित किया, जो बड़े पैमाने पर विजन-लैंग्वेज मॉडल्स को एज डेप्लॉयमेंट के लिए उपयुक्त कॉम्पैक्ट संस्करणों में डिस्टिल करने के लिए एक मास्क-प्रोग्रेसिव रिइन्फोर्समेंट लर्निंग फ्रेमवर्क है। विधि टीचर और स्टूडेंट मॉडल्स के बीच आकार अंतर से उत्पन्न अस्थिरता को संबोधित करती है।

lab NVIDIA Research · 10 दिन पहले · 36 बार देखा गया

DSTP जटिल MLLM तर्क में दृश्य टोकन प्रूनिंग विफलताओं को कम करता है

शोधकर्ताओं ने डिकोडिंग के दौरान प्रासंगिक दृश्य जानकारी शिफ्ट (RVIS) को बहुआयामी बड़े भाषा मॉडलों (MLLMs) में मौजूदा दृश्य टोकन प्रूनिंग विधियों की विफलता का मुख्य कारण पहचाना। इसका समाधान करने के लिए, वे डिकोडिंग-स्टेज शिफ्ट-अवेयर टोकन प्रूनिंग (DSTP) का प्रस्ताव करते हैं, जो एक ट्रेनिंग-फ्री फ्रेमवर्क है जो दृश्य टोकनों को बदलते तर्क आवश्यकताओं के साथ संरेखित करता है।

lab NVIDIA Research · 10 दिन पहले · 26 बार देखा गया

GenRecal पुनः कैलिब्रेशन के माध्यम से बड़े विज़न-लैंग्वेज मॉडलों को छोटे मॉडलों में डिस्टिल करता है

शोधकर्ताओं ने GenRecal प्रस्तुत किया, एक सामान्य उद्देश्य वाला डिस्टिलेशन फ्रेमवर्क जो बड़े विज़न-लैंग्वेज मॉडलों (VLMs) से ज्ञान को छोटे और अधिक कुशल प्रतिरूपों में स्थानांतरित करता है। यह विधि एक Recalibrator का उपयोग करके विभिन्न प्रकार के मॉडलों के बीच फीचर प्रतिनिधित्वों को संरेखित और अनुकूलित करके विषम VLM आर्किटेक्चर की चुनौती को संबोधित करता है।

lab NVIDIA Research · 10 दिन पहले · 28 बार देखा गया

ZPPO छोटे विज़न-लैंग्वेज मॉडल प्रशिक्षण को बेहतर बनाने के लिए ग्रेडिएंट के बजाय प्रॉम्प्ट का उपयोग करता है

शोधकर्ताओं ने ज़ोन ऑफ़ प्रोक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (ZPPO) का परिचय दिया, एक विधि जो ज्ञान विलयन में भंगुरता और पुनर्बल सीखने में विचलन को दूर करने के लिए शिक्षक के ज्ञान को पॉलिसी ग्रेडिएंट के बजाय प्रॉम्प्ट में डालती है। ZPPO कठिन प्रश्नों के लिए बाइनरी उम्मीदवार-सहित प्रश्न (BCQ) और नकारात्मक उम्मीदवार-सहित प्रश्न (NCQ) बनाता है, और जब तक छात्र की सटीकता में सुधार नहीं होता या उन्हें निकाला नहीं जाता, तब तक उन्हें रीप्ले बफ़र के माध्यम से पुनः परिसंचारित करता है।

lab NVIDIA Research · 10 दिन पहले · 21 बार देखा गया

Hide to See ने VLM डिस्टिलेशन के लिए तर्क-पूर्वअक्षर मास्किंग पेश की

शोधकर्ताओं ने एक नया सोच-जवाब डिस्टिलेशन फ्रेमवर्क प्रस्तावित किया है जो संपादित दृश्य-भाषा मॉडल की दृश्य साक्ष्य का उपयोग करने की क्षमता को महत्वपूर्ण तर्क-पूर्वअक्षरों को मास्क करके सुधारता है। यह दृष्टिकोण लंबे सोच-जवाब ट्रैकों में सामान्य "दृश्य भूल" समस्या को संबोधित करता है, जहां छात्र विस्तृत तर्क के दौरान दृश्य संकेतों पर ध्यान खो देते हैं।

lab NVIDIA Research · 10 दिन पहले · 15 बार देखा गया

SpatialClaw एजेंटिक स्थानिक तर्क के लिए क्रिया इंटरफ़ेस के रूप में कोड का उपयोग करता है

शोधकर्ता SpatialClaw का प्रस्ताव करते हैं, एक ट्रेनिंग-मुक्त फ्रेमवर्क जो दृश्य-भाषा मॉडल में खुले-अंत 3D और 4D स्थानिक तर्क को सुधारने के लिए क्रिया इंटरफ़ेस के रूप में कोड अपनाता है। मौजूदा एजेंट्स के विपरीत जो सिंगल-पास एक्जीक्यूशन या रिजिड टूल कॉल्स पर निर्भर करते हैं, SpatialClaw इनपुट फ्रेम्स और परसेप्शन प्रिमिटिव्स से पूर्व-लोडेड एक स्टेटफुल Python kernel बनाए रखता है।

lab NVIDIA Research · 10 दिन पहले · 27 बार देखा गया

AXPO ने थिंकिंग-एक्टिंग गैप को ठीक करके मल्टीमोडल एजेंटिक रीजनिंग में सुधार किया

शोधकर्ताओं ने दृश्य-भाषा मॉडलों में "थिंकिंग-एक्टिंग गैप" को संबोधित करने के लिए एजेंट एक्सप्लोरेटिव पॉलिसी ऑप्टिमाइज़ेशन (AXPO) का प्रस्ताव दिया है, जिन्हें बाहरी उपकरणों की आवश्यकता होती है। यह गैप GRPO जैसे मानक RL विधियों को केवल ~30% रोलआउट्स पर उपकरण उपयोग करने के लिए प्रेरित करता है, जिसमें उच्च विफलता दरें सीखने के संकेतों को दबा देती हैं।

lab NVIDIA Research · 15 दिन पहले · 36 बार देखा गया

ROSA साझा GPU-पूल सर्विंग के माध्यम से कार्यात्मक उत्पादकता को 12.06x तक बढ़ाता है

शोधकर्ताओं ने ROSA का प्रस्ताव रखा, जो एक रोबोटिक्स फाउंडेशन मॉडल सर्विंग सिस्टम है जो रोबोट कारखानों के लिए डिज़ाइन किया गया है और जो एकल-रोबोट, एज-कंप्यूटिंग मान्यताओं से परे जाता है। यह सिस्टम साझा GPU-पूल सर्विंग का उपयोग करता है ताकि रोबोटों के बेड़े नेटवर्क के माध्यम से सर्वर-क्लास GPUs तक पहुंच सकें।

lab NVIDIA Research · 24 दिन पहले · 28 बार देखा गया

NVIDIA ने मल्टीमोडल मॉडल के स्थानिक तर्क के लिए एक पदानुक्रमित निदान ढांचा Spatial-IQ का परिचय दिया

NVIDIA के शोधकर्ताओं ने Spatial-IQ का परिचय दिया है, जो मल्टीमोडल लार्ज लैंग्वेज मॉडल्स (MLLMs) की स्थानिक बुद्धिमत्ता को तोड़ने के लिए डिज़ाइन किया गया एक निदान ढांचा है। मौजूदा बेंचमार्क्स के विपरीत जो मॉडल्स को ब्लैक बॉक्स के रूप में मानते हैं, यह दृष्टिकोण स्टैक्ड 3D संरचनाओं में वस्तु गिनती को मानव विकास चरणों से सुसंगत नौ संवेदी और संज्ञानात्मक उप-कार्यों में विभाजित करता है।

lab NVIDIA Research · 24 दिन पहले · 38 बार देखा गया

2D गॉसियन-आधारित छवि संपीड़न के लिए क्लस्टर कोडबुक क्वांटीकरण

शोधकर्ता Cluster-Guided Vector Quantization (CGVQ) प्रस्तुत करते हैं, जो गॉसियन प्राइमिटिव-आधारित छवि संपीड़न में दर-विकृति प्रदर्शन को बेहतर बनाने के लिए डिज़ाइन किया गया एक विधि है। दृष्टिकोण क्वांटीकरण से पहले गॉसियन पैरामीटर को समजात समूहों में विभाजित करता है, जिसमें प्रति प्राइमिटिव बड़ी संख्या में फ्लोटिंग-पॉइंट पैरामीटर संग्रहीत करने के कारण होने वाली अक्षमता को दूर किया जाता है।

lab NVIDIA Research · 24 दिन पहले · 25 बार देखा गया

Delta Force में अकथित संचार का मल्टीमोडल AI विश्लेषण

शोधकर्ता प्रतिस्पर्धी शूटर गेम Delta Force के gameplay वीडियो का विश्लेषण कर रहे हैं ताकि उत्पन्न होने वाले अकथित संचार, जैसेgestures और movement patterns को निकाला और समझा जा सके। यह कार्य उन पूर्व अध्ययनों में एक अंतराल को दूर करता है जो मुख्य रूप से MOBA गेम्स या अन्य shooters में verbal coordination पर केंद्रित रहे हैं।

lab NVIDIA Research · 24 दिन पहले · 19 बार देखा गया

NVIDIA के शोधकर्ता Rocket League टूर्नामेंट में फील्ड एक्सपेरिमेंट का प्रस्ताव रखते हैं

NVIDIA के शोधकर्ता प्रतिस्पर्धी ग्रुप प्ले की शेड्यूलिंग और लैब वातावरण को पुनः बनाने की कठिनाई को हल करने के लिए फील्ड एक्सपेरिमेंट मेथडोलॉजी अपना रहे हैं। यह दृष्टिकोण प्रयोगों को टूर्नामेंट संरचनाओं में सीधे एकीकृत करता है, जिससे हाइब्रिड टूर्नामेंट-एक्सपेरिमेंट बनते हैं।