Training methods
arxiv arXiv cs.LG · 2 दिन पहले

U-OPSD LLMs के लिए अनसुपervised ऑन-पॉलिसी सेल्फ-डिस्टिलेशन को सक्षम बनाता है

शोधकर्ताओं ने अनसुपervised ऑन-पॉलिसी सेल्फ-डिस्टिलेशन (U-OPSD) का प्रस्ताव रखा है, एक विधि जो बाहरी निगरानी के बिवल मॉडल की अपनी जनरेशन का उपयोग करके बड़े भाषा मॉडलों के लिए पोस्ट-ट्रेनिंग सुधार प्राप्त करती है। यह दृष्टिकोण बहुमत वोट के माध्यम से एक pseudo-समाधान बनाने के लिए कई रोलआउट्स को सैंपल करता है, फिर शिक्षक वितरण को मॉडल की सबसे लंबी गलत पूर्णता के उपसर्गों में संक्षिप्त करता है।

media r/LocalLLaMA · 5 दिन पहले

Apple का AFM3 20B निर्देश-अनुसरण प्रuning का उपयोग करके ~20% परतों को सक्रिय करता है

Apple ने अपने तीसरी पीढ़ी के आधार मॉडलों (AFM3) के लिए एक नई आर्किटेक्चर पेश की है जो "निर्देश-अनुसरण प्रuning" का उपयोग करके सक्रिय पैरामीटर गिनती को काफी कम करता है। मॉडल को डिज़ाइन किया गया है ताकि यह अपने MLP परतों का लगभग 20% सक्रिय कर सके, प्रति टोकन के बजाय प्रति प्रम्प्ट एक बार रूटिंग निर्णय लेकर।

media MarkTechPost · 7 दिन पहले · 4 बार देखा गया

NVIDIA NeMo ने Molt जारी किया, एक संक्षिप्त PyT-native एजेंटिक RL फ्रेमवर्क

NVIDIA के NeMo टीम ने Molt जारी किया है, जो शोधकर्ताओं के लिए एल्गोरिदम पुनरावृत्ति की जटिलता को कम करने के लिए डिज़ाइन किया गया एक ओपन-सोर्स एजेंटिक रीइंफोर्स्मेंट लर्निंग फ्रेमवर्क है। कोडबेस लगभग 8.6K पंक्तियों का RL कोड है, जो verl (62K पंक्तियाँ) और slime (25K पंक्तियाँ) जैसे तुलनीय फ्रेमवर्क्स की तुलना में काफी छोटा है।

media Hugging Face Forums · 8 दिन पहले

क्या विफल एजेंट ट्रेस को फाइन-ट्यूनिंग डेटा के रूप में उपयोग किया जा सकता है, इसकी जांच

लेखक एक परिकल्पना प्रस्तुत करते हैं कि विफल टूल-यूज़िंग एजेंट ट्रेस, जैसे गलत टूल चयन या अवैध तर्क, इन त्रुटियों से मॉडलों को दूर ले जाने के लिए फाइन-ट्यूनिंग डेटा के रूप में मूल्यवान हो सकते हैं। पोस्ट इस बात पर समुदाय की प्रतिक्रिया चाहता है कि सुधारी गई विफल ट्रेस पर प्रशिक्षण प्रभावी है या हानिकारक।

media Hugging Face Forums · 9 दिन पहले

PIN v2 वजन बांधने के माध्यम से मॉडल चौड़ाई को भंडारण लागत से अलग करता है

PIN Architecture v2 वजन बांधने का उपयोग करके प्रशिक्षण से पहले एक न्यूरल नेटवर्क के आकार और इनफरेंस गति को पूर्व-चयनित करने की विधि पेश करता है। यह तकनीक कोशिकाओं के समूहों को समान मान रखने पर मजबूर करती है, जिससे नेटवर्क अपनी चौड़ाई बनाए रख सकता है जबकि भंडारित वजन की संख्या में भारी कमी आती है।

media r/LocalLLaMA · 9 दिन पहले · 1 बार देखा गया

हुआवेई ने 505B-A18B MoE मॉडल openPangu-2.0-Pro को ओपन सोर्स किया

हुआवेई ने openPangu-2.0-Pro के लिए ओपन-सोर्स वेट्स जारी किए हैं, जो एक मिक्सचर ऑफ एक्सपर्ट्स (MoE) लार्ज लैंग्वेज मॉडल है जिसे Ascend हार्डवेयर पर ट्रेन किया गया था। इस मॉडल में 505 बिलियन कुल पैरामीटर और 18 बिलियन सक्रिय पैरामीटर हैं, और यह 512k टोकन की संदर्भ लंबाई का समर्थन करता है।

arxiv arXiv cs.CL · 9 दिन पहले · 2 बार देखा गया

मेमोरी डिकोडर स्केल पर: पैरामीट्रिक लंबी अवधि की मेमोरी को 6.9B पैरामीटर तक बढ़ाना

शोधकर्ताओं ने Memory Decoder at Scale प्रस्तुत किया, एक सिस्टम जो पैरामीट्रिक लंबी अवधि की मेमोरी मॉडलों को 6.9B पैरामीटर तक स्केल करता है और उन्हें 300B टोकन पर प्रीट्रेन करता है। इस डेटा स्केल पर मानक Faiss पाइपलाइन के असंभव होने का सामना करने के लिए, लेखकों ने kNN वितरणों की स्पार्स, बैच-वाइज लोडिंग के साथ एक वितरित इंडेक्सिंग पाइपलाइन लागू की है।

lab Microsoft Research Blog · 9 दिन पहले · 3 बार देखा गया

माइक्रोसॉफ्ट रिसर्च ने एक विकसित लाइब्रेरी के साथ टेस्ट-टाइम लर्निंग के लिए EvoLib का परिचय दिया

माइक्रोसॉफ्ट रिसर्च ने EvoLib पेश किया है, एक फ्रेमवर्क जो बड़े भाषा मॉडलों को इनफरेंस के दौरान अपनी ही अनुभव से सीखने की सुविधा देता है, बिना ग्राउंड-ट्रुथ लेबल या बाहरी प्रतिक्रिया की आवश्यकता के। EvoLib कच्चे अनुभवों को स्थिर स्मृतियों के रूप में संग्रहीत करने के बजाय, उन्हें पुनः उपयोग योग्य कौशल और प्रतिबिंबी अंतर्दृष्टि में बदल देता है जो लगातार परिष्कृत, संघनित और पुनर्वजनित किए जाते हैं।

lab Microsoft Research Blog · 9 दिन पहले · 4 बार देखा गया

कंप्यूटर-उपयोग एजेंटों के प्रशिक्षण के लिए माइक्रोसॉफ्ट ने Echoverse जारी किया

माइक्रोसॉफ्ट रिसर्च ने कंप्यूटर-उपयोग एजेंटों को प्रशिक्षित करने के लिए डिज़ाइन किए गए बारह गहरे सिंथेटिक वातावरणों का एक संग्रह, Echoverse जारी किया है। इस पहल में दस डोमेन-विशिष्ट दुनियाएं और दो क्षमता-केंद्रित दुनियाएं शामिल हैं, जो सभी सहसंबद्ध स्थिति और व्यवहारिक सटीकता बनाए रखने के लिए बनाई गई हैं।

arxiv arXiv cs.CL · 11 दिन पहले

ऑन-पॉलिसी डिस्टिलेशन में Relay-OPD प्रशिक्षण ट्रेजेक्टरी की लंबाई को 50% से अधिक कम करता है

रिसर्चर्स ने मानक ऑन-पॉलिसी डिस्टिलेशन में प्रिफेक्स विफलता को दूर करने के लिए Relay On-Policy Distillation (Relay-OPD) पेश किया, जहाँ छात्र की त्रुटियाँ अविश्वसनीय निगरानी का कारण बनती हैं। इस विधि में शिक्षक-छात्र निरंतरता असममितता को ट्रिगर के रूप में उपयोग किया जाता है ताकि शिक्षक संक्षेप में नियंत्रण संभाल सके और छात्र फिर से शुरू होने से पहले ट्रेजेक्टरी को पुनर्निर्देशित कर सके।

media r/LocalLLaMA · 12 दिन पहले · 4 बार देखा गया

Google अपने Gemini मॉडल्स के लिए डिस्टिलेशन सेवा प्रदान कर रहा है

Google अब अपने Gemini मॉडल्स के लिए एक डिस्टिलेशन सेवा प्रदान कर रहा है। इससे उपयोगकर्ता Google Cloud प्लेटफ़ॉर्म के माध्यम से बड़े Gemini मॉडल्स की क्षमताओं को छोटे और अधिक कुशल संस्करणों में संपीड़ित कर सकते हैं।

arxiv arXiv cs.CL · 13 दिन पहले OSWorld · 37.7%

OpenForgeRL किसी भी वातावरण में हार्नेस-आधारित एजेंट्स के अंत-से-अंत प्रशिक्षण को सक्षम बनाता है

OpenForgeRL एक ओपन-सोर्स फ्रेमवर्क है जो शोधकर्ताओं को मान्य पुनर्बल सीखने स्टैक्स का उपयोग करके हार्नेस-आधारित AI एजेंट्स के अंत-से-अंत प्रशिक्षण की अनुमति देता है। यह एक हल्के प्रॉक्सी का उपयोग करके मॉडल कॉल को डेटा के रूप में रिकॉर्ड करने और दूरस्थ कंटेनरों में रोलआउट्स को प्रबंधित करने के लिए Kubernetes ऑर्केस्ट्रेटर का उपयोग करके प्रशिक्षण को इनफरेंस से अलग करता है।

media Hugging Face Forums · 14 दिन पहले GSM8K · 74.22%

CrowdTensor ने स्वैच्छिक-प्रशिक्षण बीटा और ड्राफ्ट Qwen2.5-7B GSM8K अभियान RFC लॉन्च किया

CrowdTensor एक Apache-2.0 ओपन-सोर्स प्रोटोकॉल है, जो चेकप्वाइंटेड स्वैच्छिक मॉडल-प्रशिक्षण अभियानों के लिए है जो स्वीकृत CPU, GPU, या TPU सेल्स को सीमित कार्य देने के लिए अपरिवर्तनीय मॉडल और डेटा संशोधनों को पिन करता है। परियोजना ने Qwen2.5-7B GSM8K अभियान के लिए एक ड्राफ्ट RFC के साथ एक बीटा नामांकन प्रक्रिया जारी की है।

media Hugging Face Forums · 15 दिन पहले

ThetaScan v0.1 ने 17M LM परिणामों के साथ ओपन स्कैन-पैरलल नॉनलिनियर मेमोरी जारी की

एक फिक्स्ड-स्टेट नॉनलिनियर टोकन मिक्सर, ThetaScan v0.1 का शोध पूर्वावलोकन एक ओपन-सोर्स इम्प्लीमेंटेशन के रूप में जारी किया गया है। आर्किटेक्चर यह सुनिश्चित करता है कि प्रत्येक टोकन अपने मेमोरी राइट को वर्तमान इनपुट और शेयर्ड पैरामीटर से गणना करे, न कि एक विकसित फास्ट स्टेट से, जिससे राइट्स को एसोसिएटिव प्रीफिक्स स्कैन के माध्यम से कंपोज करने की अनुमति मिलती है।

arxiv arXiv cs.CL · 16 दिन पहले SWE-bench Pro · 55.9% · 2 बार देखा गया

OpenForgeRL किसी भी वातावरण में हैर्नेस-आधारित एजेंट्स के अंत-से-अंत प्रशिक्षण को सक्षम बनाता है

शोधकर्ताओं ने OpenForgeRL प्रस्तुत किया, एक ओपन-सोर्स फ्रेमवर्क जो Claude Code और OpenClaw जैसी जटिल इनफरेंस हैर्नेस का उपयोग करके AI एजेंट्स के अंत-से-अंत प्रशिक्षण की अनुमति देता है। सिस्टम एक हल्के प्रॉक्सी का उपयोग करके मॉडल कॉल्स को डेटा के रूप में रिकॉर्ड करने और दूरस्थ कंटेनर रोलआउट्स को प्रबंधित करने के लिए Kubernetes ऑर्केस्ट्रेटर का उपयोग करके प्रशिक्षण को इनफरेंस से अलग करता है।

arxiv arXiv cs.AI · 16 दिन पहले OSWorld · 37.7% · 5 बार देखा गया

OpenForgeRL किसी भी वातावरण में हैरनेस-आधारित एजेंट्स के अंत-से-अंत प्रशिक्षण को सक्षम बनाता है

OpenForgeRL एक ओपन-सोर्स फ्रेमवर्क है जो शोधकर्ताओं को मानक रीइन्फोर्समेंट लर्निंग स्टैक्स का उपयोग करके हैरनेस-आधारित AI एजेंट्स के अंत-से-अंत प्रशिक्षण की अनुमति देता है। यह एक हल्के प्रॉक्सी के माध्यम से प्रशिक्षण को इनफरेंस से अलग करके इसे प्राप्त करता है जो मॉडल कॉल्स को डेटा के रूप में रिकॉर्ड करता है और एक Kubernetes ऑर्केस्ट्रेटर जो रिमोट कंटेनर रोलआउट का प्रबंधन करता है।

media Hugging Face Forums · 16 दिन पहले · 1 बार देखा गया

7B–14B पैरामीटर वाले डोमेन-विशिष्ट LLMs के उत्पादन योग्यता पर सामुदायिक चर्चा

एक Hugging Face फोरम उपयोगकर्ता जांच रहा है कि क्या 7B–14B पैरामीटर रेंज में छोटे, डोमेन-विशिष्ट बड़े भाषा मॉडल (LLMs) वास्तविक दुनिया के उत्पादन वातावरण में बड़े मॉडलों का प्रभावी रूप से स्थान ले सकते हैं।

media Hugging Face Forums · 17 दिन पहले

विश्लेषक स्वतः कोडक के साथ ELIZA

ELIZA चैटबॉट का एक नया कार्यान्वयन संवादन प्रविष्टियों को एक लीन मेमोरी परत में संग्रहीत करने के लिए स्पार्स ऑटोएन्कोडर आर्किटेक्चर का उपयोग करता है, जो पारंपरिक कीवर्ड-मैचिंग विधियों में सुधार करने का प्रयास करता है। सिस्टम 32,768-न्यूरॉन मेमोरी परत के साथ एक T5 एन्कोडर-डीकोडर संरचना का उपयोग करता है, जहाँ समान प्रविष्टियाँ कंट्रास्टिव लर्निंग के माध्यम से सक्रिय होती हैं।

media r/LocalLLaMA · 17 दिन पहले · 1 बार देखा गया

SLAI T-Rex ने Ascend पर DeepSeek-V4 के लिए 34.22% MFU और 71.81% Pass@1 हासिल किया

SLAI ने T-Rex पेश किया, जो Ascend SuperPOD इंफ्रास्ट्रक्चर पर DeepSeek-V4 मॉडल परिवार के लिए एक पूर्ण-पैरामीटर पोस्ट-ट्रेनिंग फ्रेमवर्क है। सिस्टम हियरार्किकल ऑप्टिमाइज़ेशन के माध्यम से ट्रिलियन-पैरामीटर MoE मॉडल्स में मेमोरी प्रेशर और संचार ओवरहेड को संबोधित करता है।

arxiv arXiv cs.AI · 17 दिन पहले · 4 बार देखा गया

SLAI T-Rex, Ascend SuperPOD पर DeepSeek-V4 के पूर्ण-पैरामीटर पोस्ट-ट्रेनिंग को सक्षम बनाता है

SLAI ने T-Rex पेश किया, जो Ascend NPU SuperPOD पर ट्रिलियन-पैरामीटर-स्केल MoE मॉडल्स के पूर्ण-पैरामीटर पोस्ट-ट्रेनिंग के लिए एक एंड-टू-एंड ऑप्टिमाइजेशन फ्रेमवर्क है। लक्ष्य वर्कलोड के रूप में DeepSeek-V4 मॉडल फैमिली का उपयोग करते हुए, सिस्टम हियरार्किकल पैरेलेलिज्म और कर्नेल एक्जीक्यूशन ऑप्टिमाइजेशन के माध्यम से मेमोरी प्रेशर और कम्युनिकेशन ओवरहेड को संबोधित करता है।