Training methods
media Hugging Face Forums · 20 घंटे पहले · 10 बार देखा गया

SplitMoE पैरामीटर अतिरेक कम करने के लिए बारीक विशेषज्ञ मार्गदर्शन पेश करता है

SplitMoE एक वैकल्पिक मिक्स्चर ऑफ एक्सपर्ट्स आर्किटेक्चर है जो चौड़े फ़ीड-फॉरवर्ड परतों को छोटे, विशेष उप-घटकों में तोड़ता है ताकि टोकन प्रतिनिधित्व लचीलापन और कंप्यूटेशनल मॉड्यूलैरिटी को बेहतर बनाया जा सके।

arxiv arXiv cs.AI · 22 घंटे पहले · 11 बार देखा गया

वर्ल्ड स्टेट जनरेटर एजेंट की सफलता बढ़ाने के लिए योजनाओं को सिंथेटिक दुनियाओं से संरेखित करता है

वर्ल्ड स्टेट जनरेटर (WSG) एक मॉडल है जो विफलताओं के बाद अवस्थाओं को पुनः लिखकर भाषा एजेंट की योजनाओं को उनके निष्पादन वातावरण के नियमों से संरेखित रखता है। इसे सात सिंथेटिक डोमेन से निकाले गए 226K ट्रैजेक्टरी पर प्रशिक्षित किया गया है, जहाँ एक प्रोग्राम नियमों को लागू करता है और लक्ष्य की प्राप्ति योग्यता की जाँच करता है।

arxiv arXiv cs.LG · 1 दिन पहले HealthBench · 50.1% · 10 बार देखा गया

Fathom-Vaidya रूब्रिक-आधारित पुरस्कारों के साथ चिकित्सा तर्क को बेहतर बनाता है

लेखकों ने Fathom-Vaidya का परिचय दिया, जो 30B पैरामीटर वाला एक मॉडल है जो संज्ञानात्मक और क्लिनिकल हेल्थकेयर तर्क को बढ़ाने के लिए सिंथेटिक डेटा और रूब्रिक-आधारित पुनर्बल सीखने का उपयोग करता है। प्रशिक्षण ढांचा पहले निदान के लिए MedBullets से प्राप्त प्रश्नों पर नियम-निर्देशित RL लागू करता है, फिर इंटरैक्टिव क्लिनिकल कार्यों के लिए बहु-आयामी रूब्रिक्स के साथ 5.3k सिंथेटिक मल्टी-टर्न परिदृश्यों का उपयोग करता है।

media Hugging Face Forums · 1 दिन पहले · 7 बार देखा गया

OLMo-core में Muon और Dion3 ऑप्टिमाइज़र समस्याओं को डीबग करते हुए Jen Wei

Jen Wei ने आने वाले PyTorch Conference भाषण के लिए OLMo-core के भीतर AdamW, Muon, और नवीनतम Dion3 कार्यान्वयन का परीक्षण करते समय लर्निंग रेट डेथ स्पाइरल का सामना किया।

arxiv arXiv cs.AI · 1 दिन पहले HealthBench · 50.1% · 12 बार देखा गया

Fathom-Vaidya रूबरिक-आधारित पुरस्कारों के साथ चिकित्सा तर्क को बेहतर बनाता है

लेखकों ने Fathom-Vaidya का परिचय दिया, जो 30B पैरामीटर वाला एक मॉडल है जो संश्लेषित डेटा और रूबरिक-आधारित पुनर्बल सीखने (reinforcement learning) का उपयोग करके नैदानिक और चिकित्सा स्वास्थ्य तर्क को बढ़ाने के लिए। प्रशिक्षण ढांचा पहले MedBullets से व्युत्पन्न प्रश्नों का उपयोग करके नैदानिक सटीकता पर केंद्रित होता है और फिर बहु-आयामी रूबरिक के साथ 5.3k उत्पन्न परिदृश्यों के माध्यम से बहु-चरण चिकित्सा बातचीत को संबोधित करता है।

arxiv arXiv cs.CL · 1 दिन पहले HealthBench · 50.1% · 12 बार देखा गया

Fathom-Vaidya रूब्रिक-आधारित पुरस्कारों के साथ चिकित्सा तर्क को बेहतर बनाता है

लेखकों ने Fathom-Vaidya का परिचय दिया, जो 30B पैरामीटर वाला एक मॉडल है जो सिंथेटिक डेटा और रूब्रिक-आधारित रीइन्फोर्समेंट लर्निंग का उपयोग करके नैदानिक और क्लिनिकल हेल्थकेयर तर्क को बढ़ावा देता है।

media Latent Space · 1 दिन पहले · 13 बार देखा गया

TypeSafe AI ने जेव पेश किया, जो कैलिब्रेटेड निर्णयों के लिए रीइंफोर्समेंट लर्निंग के साथ प्रशिक्षित एक सिस्टम वन मॉडल है

TypeSafe AI ने जेव लॉन्च किया, "सिस्टम वन" मॉडलों का एक नया वर्ग जो उत्पादन वातावरणों के लिए डिज़ाइन किया गया है। कम्पनी के सीईओ और इंसट्रक्टजीपीटी पेपर के सह-लेखक डियोगो अल्मेइडा का तर्क है कि वर्तमान फ्रंटियर मॉडलों ने विश्वसनीयता की तुलना में एलाइनमेंट और रिफ्यूजल्स को प्राथमिकता दी है, जिससे हैलुसिनेशन और सिसोफेन्सी जैसे मुद्दे उत्पन्न हुए हैं।

media Hugging Face Forums · 2 दिन पहले · 18 बार देखा गया

MB-Bidram ने तर्क और ज्ञान को अलग करने वाली प्रयोगात्मक WideNDepth आर्किटेक्चर साझा की

MB-Bidram ने एक प्रयोगात्मक न्यूरल आर्किटेक्चर जारी किया है जिसे WideNDepth (WND) कहा जाता है, जो तर्क करने की क्षमताओं को ज्ञान भंडारण से अलग करने के लिए डिज़ाइन किया गया है। मॉडल में एक "Wide भाग" होता है जो मेमोरी के रूप में काम करता है और एक "Depth भाग" होता है जो तर्ककर्ता के रूप में कार्य करता है।

media Hugging Face Forums · 3 दिन पहले · 16 बार देखा गया

प्रोग्रेसिव मॉडल ग्रोथ और ट्रान्सफॉर्मर्स के लिए ओपन हार्डवेयर प्रोफाइल का प्रस्ताव

Hugging Face पर एक प्रस्ताव AI में दो जुड़े हुए समस्याओं पर चर्चा करता है: अलग-अलग बड़े मॉडल के प्रशिक्षण पर निर्भरता और इकोसिस्टम की सामान्य उद्देश्य GPU पर निर्भरता।

media Hugging Face Forums · 3 दिन पहले · 18 बार देखा गया

प्रस्ताव: एक स्थिर 4B मॉडल के लिए Qwen 9B से 27B तक क्रमिक ज्ञान स्थानांतरण

Hugging Face फोरम पर एक उपयोगकर्ता ने क्रमिक ज्ञान स्थानांतरण में एक प्रयोग का प्रस्ताव रखा है, जहां एक स्थिर-आकार का छात्र मॉडल (Qwen 4B) सबसे बड़े उपलब्ध स्रोत से सीधे सीखने के बजाय बढ़ते आकार के शिक्षक मॉडलों से क्रमिक रूप से सीखता है।

media MarkTechPost · 6 दिन पहले · 20 बार देखा गया

OpenAI ने 3 समीक्षा पथों के साथ मॉडल असंरेखण अनावरण ढांचा जारी किया

OpenAI ने अपने मॉडलों में असंरेखण को ट्रैक करने, जांचने और अनावरण करने के लिए एक नया ढांचा पेश किया है, जिसके साथ पुनर्बल सीखन प्रशिक्षण से छह विस्तृत घटना रिपोर्ट शामिल हैं। यह प्रणाली सार्वजनिक अनावरण के लिए विशिष्ट मानदंड और समयसीमा स्थापित करती है, यहाँ तक कि जब व्यवहार पूरी तरह से समझाया या कम नहीं किया गया हो।

media Hugging Face Forums · 7 दिन पहले · 15 बार देखा गया

ByteLex टोकनाइज़र मैप का उपयोग करके बाइट-मॉडल त्रुटियों की भविष्यवाणी और सुधार करता है

ByteLex के शोधकर्ताओं ने 11 टोकनाइज़र शब्दावलियों से एक निर्देशांक स्थान बनाया ताकि यह भविष्यवाणी कर सकें कि उनका बाइट-स्तरीय भाषा मॉडल किस काल्पनिक शब्द पर विफल होगा। मैप ने मॉडल की मापी गई प्रति-शब्द सटीकता के साथ -0.98 का स्पीयरमैन सहसंबंध प्राप्त किया, जो कॉर्पस से व्युत्पन्न सांख्यिकी से बेहतर है।

arxiv arXiv cs.LG · 7 दिन पहले · 20 बार देखा गया

OpenAI ने पूरी तरह से ऑडिट करने योग्य ट्रेनिंग रन के साथ Open-1B जारी किया

OpenAI ने Open-1B जारी किया है, एक भाषा मॉडल जिसे ऐसे नियम में प्रशिक्षित किया गया है जहाँ प्रशिक्षण के दौरान हर ऑपरेशन विषम कम्प्यूटिंग हार्डवेयर पर बिट-स्तर की सटीकता के साथ स्वतंत्र रूप से पुनरुत्पादित हो सकता है। यह दृष्टिकोण ओपन-सोर्स मॉडलों में निहित पुनरुत्पादन की समस्याओं को GPU kernel reductions और डेटा बैच ऑर्डरिंग जैसे नॉन-डिटरमिनिज्म स्रोतों पर एक निश्चित क्रम लागू करके हल करता है।

lab Hugging Face Blog · 9 दिन पहले · 16 बार देखा गया

TRL v1.14 का AsyncGRPOTrainer Hugging Face Jobs में LoRA-मात्र समन्वयन सक्षम करता है

TRL v1.14 ने AsyncGRPOTrainer में LoRA समर्थन पेश किया, जिससे यह एक Low-Rank Adaptation एडेप्टर को प्रशिक्षित कर सकता है और केवल उस छोटे फ़ाइल को vLLM इनफ़रेंस वर्करों पर समन्वयित कर सकता है। यह आर्किटेक्चर एक साझा Storage Bucket को फ़ाइल सिस्टम ब्रिज के रूप में उपयोग करके अलग-अलग मशीनों पर प्रशिक्षण और जनरेटिंग जॉब्स को अलग करता है, जिससे नोड्स के बीच NCCL या सीधे नेटवर्क संचार की आवश्यकता समाप्त हो जाती है।

media Hugging Face Forums · 11 दिन पहले · 16 बार देखा गया

pop123-ux ने Hugging Face को सीखने के लिए अभिव्यक्तियों को हटाकर 38 चलाए जाने वाले नोटबुक जारी किए

उपयोगकर्ता pop123-ux ने एक शिक्षा भंडार प्रकाशित किया है जिसमें 38 चलाए जाने वाले नोटबुक शामिल हैं जो उच्च-स्तरीय अभिव्यक्तियों को क्रमिक रूप से हटाकर उपयोगकर्ताओं को Hugging Face स्टैक को समझने में मदद करने के लिए डिज़ाइन किए गए हैं। संग्रह transformers और tokenizers जैसे मुख्य घटकों से लेकर फाइन-ट्यूनिंग, PEFT, तर्क/RL और अंत-से-अंत परियोजना कार्य तक के मार्ग को कवर करता है।

media Together AI Blog · 12 दिन पहले Terminal-Bench 2 · 88.2% · 30 बार देखा गया

Together AI ने विशेषज्ञ LoRA, लाइव मेट्रिक्स और कीमतों में कमी के साथ फाइन-ट्यूनिंग का विस्तार किया

Together AI ने GLM-5.3 और Kimi K2.7 सहित अधिक खुले-वजन वाले मॉडलों को समर्थन देने के लिए अपनी फाइन-ट्यूनिंग सेवा का विस्तार किया है, साथ ही लाइव प्रयोग ट्रैकिंग और प्रशिक्षण प्रक्रिया पर बेहतर नियंत्रण पेश किए हैं।

media MarkTechPost · 12 दिन पहले Berkeley Function-Calling Leaderboard · 83.2% · 18 बार देखा गया

गूगल रिसर्च ने ToolGrad जारी किया, एक टूल-यूज़ डेटा जनरेशन फ्रेमवर्क

गूगल और कई जापानी विश्वविद्यालयों के शोधकर्ताओं ने ToolGrad पेश किया है, एक फ्रेमवर्क जो टूल-यूज़ डेटासेट बनाने की पारंपरिक पाइपलाइन को उलट देता है, पहले सत्यापित API चेन बनाकर और फिर उनसे मेल खाने वाले उपयोगकर्ता क्वेरी लिखकर। यह दृष्टिकोण उन क्वेरी-फर्स्ट विधियों की अक्षमता को समाप्त करने का लक्ष्य रखता है जो अक्सर एजेंट अन्वेषण के दौरान विफल हो जाती हैं।

arxiv arXiv cs.CL · 14 दिन पहले SWE-bench Verified · 72.6% · 25 बार देखा गया

ExecCritic भूमिका-विशिष्ट RL का उपयोग करके परीक्षण-निर्देशित मरम्मत के माध्यम से कोडिंग एजेंट्स में सुधार करता है

शोधकर्ताओं ने ExecCritic पेश किया, एक फ्रेमवर्क जो टेस्ट-सत्यापित-संशोधन स्केफोल्ड को भूमिका-विशिष्ट पुनर्बल सीखने के साथ मिलाकर कोडिंग एजेंट्स को बेहतर बनाता है। सिस्टम परीक्षण निर्माण और स्रोत-कोड मरम्मत को अलग करता है, एक Test एजेंट का उपयोग रिपॉजिटरी-नेटिव परीक्षण उत्पन्न करने के लिए और एक Repair एजेंट का उपयोग निष्पादन फीडबैक के आधार पर कोड संशोधित करने के लिए।

media Hugging Face Forums · 16 दिन पहले · 15 बार देखा गया

memaudit SFT प्रशिक्षण के दौरान स्मृति की जाँच के लिए डिकॉय इंजेक्ट करता है

memaudit एक उपकरण है जो TRL लाइब्रेरी के साथ एकीकृत होता है ताकि यह सत्यापित किया जा सके कि निजी डेटा पर मॉडल को फाइन-ट्यून करने से स्मृति (memorization) हुई है या नहीं। यह डेटासेट में कैलिब्रेटेड डिकॉय सीक्रेट्स इंजेक्ट कर और प्रशिक्षण प्रक्रिया के दौरान नुकसान (loss) की निगरानी करके काम करता है।

media Hugging Face Forums · 16 दिन पहले · 18 बार देखा गया

KV Graft Steering KV अवस्थाओं को फ्रीज करके अवधारणाओं को स्थानांतरित करता है

एक प्रदर्शन दिखाता है कि एक गाइड पाठ से कुंजी-मान (KV) अवस्थाओं को फ्रीज करने से Qwen2.5-3B-Instruct मॉडल नई निर्देशों को लागू कर सकता है बिना गाइड को लाइव प्रॉम्प्ट में शामिल किए। विधि में एक बार मॉडल के माध्यम से एक गाइड चलाना, इसके KV कैश को फ्रीज करना और फिर उस छिपे हुए पूर्वाग्रह के ऊपर प्रतिक्रियाएं उत्पन्न करना शामिल है।