विषय · Training methods
lab Microsoft Research Blog · 15 दिन पहले · 7 बार देखा गया

कंप्यूटर-उपयोग एजेंटों के प्रशिक्षण के लिए माइक्रोसॉफ्ट ने Echoverse जारी किया

माइक्रोसॉफ्ट रिसर्च ने कंप्यूटर-उपयोग एजेंटों को प्रशिक्षित करने के लिए डिज़ाइन किए गए बारह गहरे सिंथेटिक वातावरणों का एक संग्रह, Echoverse जारी किया है। इस पहल में दस डोमेन-विशिष्ट दुनियाएं और दो क्षमता-केंद्रित दुनियाएं शामिल हैं, जो सभी सहसंबद्ध स्थिति और व्यवहारिक सटीकता बनाए रखने के लिए बनाई गई हैं।

lab NVIDIA Research · 2 दिन पहले · 38 बार देखा गया

LLM हाइपरपैरामीटर ऑप्टिमाइज़ेशन में बेयसियन ऑप्टिमाइज़ेशन के बराबर या बेहतर हैं

एक नई शोध पत्र मौलिक बड़े भाषा मॉडलों (LLM) का उपयोग हाइपरपैरामीटर ऑप्टिमाइज़ेशन (HPO) को स्वचालित करने के लिए करता है, जो एक प्रक्रिया है जो आमतौर पर सीमित-बजट सेटिंग्स में मानव दृष्टिकोणों पर निर्भर करती है। लेखकों ने एक विधि विकसित की जहाँ LLM डेटासेट और मॉडल के विवरण के आधार पर हाइपरपैरामीटर कॉन्फ़िगरेशन सुझाते हैं, जिन्हें मॉडल के प्रदर्शन के अनुसार पुनः परिष्कृत किया जाता है।

lab NVIDIA Research · 2 दिन पहले · 40 बार देखा गया

स्रोत प्रशिक्षण डेटा एट्रिब्यूशन के लिए अनुमानित अनरोल्ड डिफरेंशिएशन पेश करता है

शोधकर्ताओं ने स्रोत पेश किया, जो एक नया प्रशिक्षण डेटा एट्रिब्यूशन (TDA) विधि है जो प्रभाव फलनों की कंप्यूटेशनल दक्षता को अनरोलिंग-आधारित दृष्टिकोणों की सटीकता के साथ जोड़ती है। प्रभाव-फलन जैसी सूत्र का उपयोग करके अनरोल्ड डिफरेंशिएशन को अनुमानित करने द्वारा, स्रोत अंतर्निहित डिफरेंशिएशन विधियों में सीमाओं को दूर करता है, जैसे कि उनका ऑप्टिमाइजेशन बायस या बहु-चरण पाइलाइन को ध्यान में न रखना।

lab NVIDIA Research · 2 दिन पहले · 9 बार देखा गया

JacNet संरचित जैकोबियन को सीधे मॉडल करके फ़ंक्शंस सीखता है

पत्र में JacNet का परिचय दिया गया है, जो एक तंत्रिका नेटवर्क आर्किटेक्चर है जो इनपुट-आउटपुट फ़ंक्शन के जैकोबियन को सीधे सीखता है, न कि मैपिंग को। यह दृष्टिकोण अवकलज गुणों पर सटीक नियंत्रण की अनुमति देता है, जिससे व्युत्क्रमणीयता और k-Lipschitz निरंतरता जैसे संरचनात्मक पूर्वज्ञान को लागू करने की सुविधा मिलती है।

lab NVIDIA Research · 3 दिन पहले · 12 बार देखा गया

jlorraine गहन शिक्षण के लिए स्केलेबल नेस्टेड ऑप्टिमाइजेशन टूल्स प्रस्तुत करता है

लेख में jlorraine द्वारा एक शोधपत्र का परिचय दिया गया है जो बड़े-पैमाने पर गहन शिक्षण सेटअप में बाइलेवल या नेस्टेड ऑप्टिमाइजेशन लागू करने की चुनौतियों को संबोधित करता है। जबकि ग्रेडिएंट-आधारित ऑप्टिमाइजेशन आमतौर पर पैरामीटर के एक सेट को अपडेट करता है, कई अनुप्रयोगों में एक-दूसरे के अंदर नेस्टेड विभिन्न उद्देश्यों पर पैरामीटर के उपसमुच्चयों को अपडेट करने की आवश्यकता होती है।

lab NVIDIA Research · 3 दिन पहले · 6 बार देखा गया

Masters मास्किंग टीचर और स्टूडेंट को रिइन्फोर्सिंग के जरिए विजन-लैंग्वेज मॉडल्स को डिस्टिल करता है

शोधकर्ताओं ने Masters प्रस्तावित किया, जो बड़े पैमाने पर विजन-लैंग्वेज मॉडल्स को एज डेप्लॉयमेंट के लिए उपयुक्त कॉम्पैक्ट संस्करणों में डिस्टिल करने के लिए एक मास्क-प्रोग्रेसिव रिइन्फोर्समेंट लर्निंग फ्रेमवर्क है। विधि टीचर और स्टूडेंट मॉडल्स के बीच आकार अंतर से उत्पन्न अस्थिरता को संबोधित करती है।

lab NVIDIA Research · 4 दिन पहले · 9 बार देखा गया

ZPPO छोटे विज़न-लैंग्वेज मॉडल प्रशिक्षण को बेहतर बनाने के लिए ग्रेडिएंट के बजाय प्रॉम्प्ट का उपयोग करता है

शोधकर्ताओं ने ज़ोन ऑफ़ प्रोक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (ZPPO) का परिचय दिया, एक विधि जो ज्ञान विलयन में भंगुरता और पुनर्बल सीखने में विचलन को दूर करने के लिए शिक्षक के ज्ञान को पॉलिसी ग्रेडिएंट के बजाय प्रॉम्प्ट में डालती है। ZPPO कठिन प्रश्नों के लिए बाइनरी उम्मीदवार-सहित प्रश्न (BCQ) और नकारात्मक उम्मीदवार-सहित प्रश्न (NCQ) बनाता है, और जब तक छात्र की सटीकता में सुधार नहीं होता या उन्हें निकाला नहीं जाता, तब तक उन्हें रीप्ले बफ़र के माध्यम से पुनः परिसंचारित करता है।

lab Microsoft Research Blog · 15 दिन पहले · 4 बार देखा गया

माइक्रोसॉफ्ट रिसर्च ने एक विकसित लाइब्रेरी के साथ टेस्ट-टाइम लर्निंग के लिए EvoLib का परिचय दिया

माइक्रोसॉफ्ट रिसर्च ने EvoLib पेश किया है, एक फ्रेमवर्क जो बड़े भाषा मॉडलों को इनफरेंस के दौरान अपनी ही अनुभव से सीखने की सुविधा देता है, बिना ग्राउंड-ट्रुथ लेबल या बाहरी प्रतिक्रिया की आवश्यकता के। EvoLib कच्चे अनुभवों को स्थिर स्मृतियों के रूप में संग्रहीत करने के बजाय, उन्हें पुनः उपयोग योग्य कौशल और प्रतिबिंबी अंतर्दृष्टि में बदल देता है जो लगातार परिष्कृत, संघनित और पुनर्वजनित किए जाते हैं।

lab Hugging Face Blog · 29 दिन पहले · 2 बार देखा गया

विशेषज्ञता के माध्यम से DharmaOCR ने ब्राज़ीलियन पुर्तगाली पर नए मॉडलों को पछाड़ दिया

DharmaOCR डोमेन-विशिष्ट प्रशिक्षण के माध्यम से ब्राज़ीलियन पुर्तगाली पर Mistral OCR4 और Unlimited-OCR की तुलना में उच्चतर निष्कर्षण गुणवत्ता और स्थिरता हासिल करता है।

media Hugging Face Forums · 1 दिन पहले · 1 बार देखा गया

ThetaMem स्थिर-अवस्था क्रम स्मृति के लिए हस्ताक्षरित गुणात्मक कुंजी उन्नयन प्रस्तावित करता है

ThetaMem एक पूर्वानुमानित, सिंगल-सीड अध्ययन है जो पुनरावर्ती मिक्सर का परीक्षण करता है, जो गेटिंग तंत्रों को परिष्कृत करने के बजाय सीखे गए हस्ताक्षरित हडामार्ड या बाहरी-गुणनफल कुंजी उन्नयनों के माध्यम से पुनरावर्ती अवस्था को संशोधित करता है। लेखक ने संश्लेषणात्मक बेंचमार्क्स पर मिश्रित परिणाम प्रस्तुत किए हैं और स्पष्ट रूप से दृष्टिकोण को असत्य सिद्ध करने वाले सबसे सस्ते प्रयोग की पहचान करने के लिए आलोचना की खोज कर रहे हैं।

media MarkTechPost · 1 दिन पहले · 6 बार देखा गया

Dyna Robotics ने 1 मिलियन घंटे के मानवीय वीडियो पर पूर्व-प्रशिक्षित किया Dyna-2, एक विश्व-क्रिया मॉडल

Dyna Robotics ने Dyna-2 जारी किया है, जो रोबोट हैंडलिंग के लिए एक विश्व-क्रिया मॉडल है जिसे 1 मिलियन घंटे से अधिक के एगोसेंट्रिक मानवीय वीडियो पर पूर्व-प्रशिक्षित किया गया था। कंपनी ने दिखाया कि साधारण मानवीय वीडियो क्रिया-लेबल वाले डेटा का विकल्प बन सकता है, 1,000 से 1,000,000 घंटे तक स्केलिंग कानून स्थापित करके।

arxiv arXiv cs.AI · 3 दिन पहले

संदर्भ-मुक्त पोस्ट-ट्रेनिंग के माध्यम से MiLMMT-46-v1.0 बहुभाषी अनुवाद में सुधार करता है

शोधकर्ताओं ने MiLMMT-46-v1.0 विकसित किया है, जो एक बहुभाषी मशीन अनुवाद मॉडल है जो खुले बड़े भाषा मॉडलों पर संदर्भ-मुक्त पोस्ट-ट्रेनिंग लागू करता है। टीम ने भाषा पहचान द्वारा गेट किए गए दो संदर्भ-मुक्त गुणाकार अनुमान मॉडलों पर आधारित पुरस्कार के साथ ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) का उपयोग किया है।

arxiv arXiv cs.CL · 3 दिन पहले · 1 बार देखा गया

MiLMMT-46-v1.0 ने संदर्भ-मुक्त पोस्ट-ट्रेनिंग के माध्यम से बहुभाषी अनुवाद में सुधार किया

शोधकर्ताओं ने MiLMMT-46-v1.0 जारी किया है, जो एक खुला बड़ा भाषा मॉडल है जो संदर्भ-मुक्त पोस्ट-ट्रेनिंग का उपयोग करके बहुभाषी मशीन अनुवाद के लिए बनाया गया है। निगरानी-फाइन-ट्यून्ड MiLMMT-46-v0.1 से शुरू करते हुए, टीम ने भाषा पहचान द्वारा गेट किए गए दो संदर्भ-मुक्त गुणाकार अनुमान मॉडलों पर आधारित पुरस्कार के साथ ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) लागू किया।

lab Hugging Face Blog · 4 दिन पहले · 8 बार देखा गया

मल्टीवर्स कंप्यूटिंग ने फ्यूज्ड चंक्ड KL लॉस के साथ ज्ञान विलय VRAM कम किया

मल्टीवर्स कंप्यूटिंग ने ऑफलाइन टॉप-K लॉग्स कैशिंग को एक फ्यूज्ड चंक्ड कुलबैक-लीब्लर (KL) अवचलन हानि के साथ जोड़कर बड़े भाषा मॉडल ज्ञान विलय के लिए मेमोरी-कुशल दृष्टिकोण पेश किया। इस विधि से शिक्षक और छात्र दोनों मॉडलों को एक साथ मेमोरी में रखने की आवश्यकता समाप्त हो जाती है, जिससे VRAM की आवश्यकताएं काफी कम हो जाती हैं।

media r/LocalLLaMA · 5 दिन पहले · 9 बार देखा गया

ByteDance AI विलयन से बचने और अपने तरीके से नए मॉडल विकसित करने का वादा करता है

ByteDance ने अपनी अगली पीढ़ी के AI मॉडल को AI विलयन तकनीकों पर निर्भर किए बिना विकसित करने की प्रतिबद्धता का ऐलान किया है।

arxiv arXiv cs.LG · 8 दिन पहले

U-OPSD LLMs के लिए अनसुपervised ऑन-पॉलिसी सेल्फ-डिस्टिलेशन को सक्षम बनाता है

शोधकर्ताओं ने अनसुपervised ऑन-पॉलिसी सेल्फ-डिस्टिलेशन (U-OPSD) का प्रस्ताव रखा है, एक विधि जो बाहरी निगरानी के बिवल मॉडल की अपनी जनरेशन का उपयोग करके बड़े भाषा मॉडलों के लिए पोस्ट-ट्रेनिंग सुधार प्राप्त करती है। यह दृष्टिकोण बहुमत वोट के माध्यम से एक pseudo-समाधान बनाने के लिए कई रोलआउट्स को सैंपल करता है, फिर शिक्षक वितरण को मॉडल की सबसे लंबी गलत पूर्णता के उपसर्गों में संक्षिप्त करता है।

media r/LocalLLaMA · 11 दिन पहले · 5 बार देखा गया

Apple का AFM3 20B निर्देश-अनुसरण प्रuning का उपयोग करके ~20% परतों को सक्रिय करता है

Apple ने अपने तीसरी पीढ़ी के आधार मॉडलों (AFM3) के लिए एक नई आर्किटेक्चर पेश की है जो "निर्देश-अनुसरण प्रuning" का उपयोग करके सक्रिय पैरामीटर गिनती को काफी कम करता है। मॉडल को डिज़ाइन किया गया है ताकि यह अपने MLP परतों का लगभग 20% सक्रिय कर सके, प्रति टोकन के बजाय प्रति प्रम्प्ट एक बार रूटिंग निर्णय लेकर।

media MarkTechPost · 12 दिन पहले · 4 बार देखा गया

NVIDIA NeMo ने Molt जारी किया, एक संक्षिप्त PyT-native एजेंटिक RL फ्रेमवर्क

NVIDIA के NeMo टीम ने Molt जारी किया है, जो शोधकर्ताओं के लिए एल्गोरिदम पुनरावृत्ति की जटिलता को कम करने के लिए डिज़ाइन किया गया एक ओपन-सोर्स एजेंटिक रीइंफोर्स्मेंट लर्निंग फ्रेमवर्क है। कोडबेस लगभग 8.6K पंक्तियों का RL कोड है, जो verl (62K पंक्तियाँ) और slime (25K पंक्तियाँ) जैसे तुलनीय फ्रेमवर्क्स की तुलना में काफी छोटा है।

media Hugging Face Forums · 13 दिन पहले

क्या विफल एजेंट ट्रेस को फाइन-ट्यूनिंग डेटा के रूप में उपयोग किया जा सकता है, इसकी जांच

लेखक एक परिकल्पना प्रस्तुत करते हैं कि विफल टूल-यूज़िंग एजेंट ट्रेस, जैसे गलत टूल चयन या अवैध तर्क, इन त्रुटियों से मॉडलों को दूर ले जाने के लिए फाइन-ट्यूनिंग डेटा के रूप में मूल्यवान हो सकते हैं। पोस्ट इस बात पर समुदाय की प्रतिक्रिया चाहता है कि सुधारी गई विफल ट्रेस पर प्रशिक्षण प्रभावी है या हानिकारक।

media Hugging Face Forums · 14 दिन पहले · 3 बार देखा गया

PIN v2 वजन बांधने के माध्यम से मॉडल चौड़ाई को भंडारण लागत से अलग करता है

PIN Architecture v2 वजन बांधने का उपयोग करके प्रशिक्षण से पहले एक न्यूरल नेटवर्क के आकार और इनफरेंस गति को पूर्व-चयनित करने की विधि पेश करता है। यह तकनीक कोशिकाओं के समूहों को समान मान रखने पर मजबूर करती है, जिससे नेटवर्क अपनी चौड़ाई बनाए रख सकता है जबकि भंडारित वजन की संख्या में भारी कमी आती है।