विषय · Training methods
arxiv arXiv cs.CL · 16 घंटे पहले · 1 बार देखा गया

संदर्भ भाषा मॉडल संदर्भ को संपादन योग्य फ़ाइलों के रूप में स्वतः प्रबंधित करते हैं

शोधकर्ताओं ने संदर्भ भाषा मॉडल (CLMs) का परिचय दिया है, जो एक नई आर्किटेक्चर है जो मॉडल के संदर्भ विंडो को एक संपादन योग्य फ़ाइल के रूप में मानती है, जिससे मॉडल अपने स्मृति में बिना किसी प्रतिबंध के अद्यतन कर सकता है। यह दृष्टिकोण संदर्भ प्रबंधन को बाहरी हार्नेस नियंत्रण से आंतरिक मॉडल व्यवहार की ओर स्थानांतरित करता है, जिससे संदर्भ-प्रबंधन रणनीतियों का संदर्भ-में और पैरामीट्रिक सीखना संभव होता है।

arxiv arXiv cs.CL · 2 दिन पहले SWE-bench Verified · 49.2% · 1 बार देखा गया

ROFT स्व-उत्पन्न व्याख्याओं पर फाइन-ट्यून करके एजेंटिक मॉडलों को बेहतर बनाता है

शोधकर्ता रेट्रोस्पेक्शन-ओनली फाइन-ट्यूनिंग (ROFT) की जांच कर रहे हैं, जो एक न्यूनतम ऑनलाइन प्रक्रिया है जहाँ एक एजेंट अपने अनुभवों की पश्चातवृत्ति व्याख्याएँ उत्पन्न करता है और केवल उन व्याख्या टोकनों पर अगले-टोकन पूर्वानुमान हानि का उपयोग करके फाइन-ट्यून किया जाता है। इस विधि को किसी बाहरी शिक्षक या पुरस्कार-आधारित नीति अपडेट की आवश्यकता नहीं है।

media Hugging Face Forums · 3 दिन पहले · 3 बार देखा गया

शोधकर्ता ज्ञान विलयन इंजीनियरी चुनौतियों के साथ उद्योग अनुभव की तलाश में है

लॉगिट-आधारित ज्ञान विलयन पर अपनी अन्वेषणात्मक कार्य साझा करने वाला एक शोधकर्ता समुदाय से वास्तविक-दुनिया के उद्योग अनुभव और इंजीनियरी अंतर्दृष्टि की मांग कर रहा है।

arxiv arXiv cs.CL · 7 दिन पहले · 8 बार देखा गया

VHD-Play हल किए गए तंत्रों से एजेंटिक RL पर्यावरण उत्पन्न करता है

VHD-Play एक पाइपलाइन है जो गणितीय मॉडलों को सैंपल और हल करने के बाद उनके निर्णय प्रक्रियाओं को स्टेटफुल टूल्स के रूप में रेंडर करके विविध एजेंटिक रिइन्फोर्समेंट लर्निंग पर्यावरण उत्पन्न करता है। यह दृष्टिकोण सुनिश्चित करता है कि निष्पादन योग्य गतिशीलता और ट्राजेक्टरी-स्कोरिंग संदर्भ सीधे हल किए गए मॉडल से विरासत में मिलें, जो मौजूदा जनरेशन पाइपलाइनों में सामान्य असंगति समस्याओं को दूर करता है।

arxiv arXiv cs.CL · 7 दिन पहले SWE-Lancer · 51.47% · 10 बार देखा गया

SkillGym मानवीय कौशल को LLMs में एकीकृत करता है ताकि वास्तविक दुनिया की समस्याओं का समाधान किया जा सके

शोधकर्ताओं ने SkillGym पेश किया, एक फ्रेमवर्क जो मानव-लेखित एजेंट कौशल को बड़े भाषा मॉडल एजेंट्स के लिए निष्पादन योग्य और सत्यापन योग्य प्रशिक्षण वातावरणों में परिवर्तित करता है। सिस्टम एक skill-to-task पाइपलाइन का उपयोग करके ठोस कार्यों को तैनात करता है और कोड-आधारित चेकरों के साथ परिणामों की पुष्टि करता है।

media Together AI Blog · 7 दिन पहले · 3 बार देखा गया

Together AI Qwen3.5 4B पर Jev-जैसी क्लासिफायर को $17 में फाइन-ट्यून करने की सुविधा देता है

Together AI ने Qwen3.5 4B बेस मॉडल का उपयोग करके Jev के समान एक वर्गीकरण मॉडल को फाइन-ट्यून करने के लिए एक गाइड और ओपन-सोर्स रिपॉजिटरी जारी की है।

lab Hugging Face Blog · 7 दिन पहले · 16 बार देखा गया

NVIDIA Warp और MjWarp GPU-त्वरित समानांतर रोबोटिक्स सिम्युलेशन को सक्षम बनाते हैं

NVIDIA Warp पर निर्मित MuJoCo Warp (MJWarp), संगत MuJoCo मॉडलों को GPU स्केल पर चलने की अनुमति देता है, जिससे एक ही कॉल में सैकड़ों या हज़ारों स्वतंत्र सिम्युलेशन दुनियाओं के विकास की सुविधा मिलती है। यह आर्किटेक्चर एकमात्र वातावरण के लिए अल्पविलंबता को कम करने से ध्यान को समग्र थ्रूपुट में सुधार पर स्थानांतरित करता है, जो पुनर्बल सीखने और बड़े-पैमाने के नमूनाकरण का समर्थन करता है।

media Hugging Face Forums · 8 दिन पहले · 13 बार देखा गया

SplitMoE पैरामीटर अतिरेक कम करने के लिए बारीक विशेषज्ञ मार्गदर्शन पेश करता है

SplitMoE एक वैकल्पिक मिक्स्चर ऑफ एक्सपर्ट्स आर्किटेक्चर है जो चौड़े फ़ीड-फॉरवर्ड परतों को छोटे, विशेष उप-घटकों में तोड़ता है ताकि टोकन प्रतिनिधित्व लचीलापन और कंप्यूटेशनल मॉड्यूलैरिटी को बेहतर बनाया जा सके।

arxiv arXiv cs.AI · 8 दिन पहले · 17 बार देखा गया

वर्ल्ड स्टेट जनरेटर एजेंट की सफलता बढ़ाने के लिए योजनाओं को सिंथेटिक दुनियाओं से संरेखित करता है

वर्ल्ड स्टेट जनरेटर (WSG) एक मॉडल है जो विफलताओं के बाद अवस्थाओं को पुनः लिखकर भाषा एजेंट की योजनाओं को उनके निष्पादन वातावरण के नियमों से संरेखित रखता है। इसे सात सिंथेटिक डोमेन से निकाले गए 226K ट्रैजेक्टरी पर प्रशिक्षित किया गया है, जहाँ एक प्रोग्राम नियमों को लागू करता है और लक्ष्य की प्राप्ति योग्यता की जाँच करता है।

arxiv arXiv cs.LG · 9 दिन पहले HealthBench · 50.1% · 13 बार देखा गया

Fathom-Vaidya रूब्रिक-आधारित पुरस्कारों के साथ चिकित्सा तर्क को बेहतर बनाता है

लेखकों ने Fathom-Vaidya का परिचय दिया, जो 30B पैरामीटर वाला एक मॉडल है जो संज्ञानात्मक और क्लिनिकल हेल्थकेयर तर्क को बढ़ाने के लिए सिंथेटिक डेटा और रूब्रिक-आधारित पुनर्बल सीखने का उपयोग करता है। प्रशिक्षण ढांचा पहले निदान के लिए MedBullets से प्राप्त प्रश्नों पर नियम-निर्देशित RL लागू करता है, फिर इंटरैक्टिव क्लिनिकल कार्यों के लिए बहु-आयामी रूब्रिक्स के साथ 5.3k सिंथेटिक मल्टी-टर्न परिदृश्यों का उपयोग करता है।

media Hugging Face Forums · 9 दिन पहले · 14 बार देखा गया

OLMo-core में Muon और Dion3 ऑप्टिमाइज़र समस्याओं को डीबग करते हुए Jen Wei

Jen Wei ने आने वाले PyTorch Conference भाषण के लिए OLMo-core के भीतर AdamW, Muon, और नवीनतम Dion3 कार्यान्वयन का परीक्षण करते समय लर्निंग रेट डेथ स्पाइरल का सामना किया।

arxiv arXiv cs.AI · 9 दिन पहले HealthBench · 50.1% · 16 बार देखा गया

Fathom-Vaidya रूबरिक-आधारित पुरस्कारों के साथ चिकित्सा तर्क को बेहतर बनाता है

लेखकों ने Fathom-Vaidya का परिचय दिया, जो 30B पैरामीटर वाला एक मॉडल है जो संश्लेषित डेटा और रूबरिक-आधारित पुनर्बल सीखने (reinforcement learning) का उपयोग करके नैदानिक और चिकित्सा स्वास्थ्य तर्क को बढ़ाने के लिए। प्रशिक्षण ढांचा पहले MedBullets से व्युत्पन्न प्रश्नों का उपयोग करके नैदानिक सटीकता पर केंद्रित होता है और फिर बहु-आयामी रूबरिक के साथ 5.3k उत्पन्न परिदृश्यों के माध्यम से बहु-चरण चिकित्सा बातचीत को संबोधित करता है।

arxiv arXiv cs.CL · 9 दिन पहले HealthBench · 50.1% · 14 बार देखा गया

Fathom-Vaidya रूब्रिक-आधारित पुरस्कारों के साथ चिकित्सा तर्क को बेहतर बनाता है

लेखकों ने Fathom-Vaidya का परिचय दिया, जो 30B पैरामीटर वाला एक मॉडल है जो सिंथेटिक डेटा और रूब्रिक-आधारित रीइन्फोर्समेंट लर्निंग का उपयोग करके नैदानिक और क्लिनिकल हेल्थकेयर तर्क को बढ़ावा देता है।

media Latent Space · 9 दिन पहले · 22 बार देखा गया

TypeSafe AI ने जेव पेश किया, जो कैलिब्रेटेड निर्णयों के लिए रीइंफोर्समेंट लर्निंग के साथ प्रशिक्षित एक सिस्टम वन मॉडल है

TypeSafe AI ने जेव लॉन्च किया, "सिस्टम वन" मॉडलों का एक नया वर्ग जो उत्पादन वातावरणों के लिए डिज़ाइन किया गया है। कम्पनी के सीईओ और इंसट्रक्टजीपीटी पेपर के सह-लेखक डियोगो अल्मेइडा का तर्क है कि वर्तमान फ्रंटियर मॉडलों ने विश्वसनीयता की तुलना में एलाइनमेंट और रिफ्यूजल्स को प्राथमिकता दी है, जिससे हैलुसिनेशन और सिसोफेन्सी जैसे मुद्दे उत्पन्न हुए हैं।

media Hugging Face Forums · 10 दिन पहले · 21 बार देखा गया

MB-Bidram ने तर्क और ज्ञान को अलग करने वाली प्रयोगात्मक WideNDepth आर्किटेक्चर साझा की

MB-Bidram ने एक प्रयोगात्मक न्यूरल आर्किटेक्चर जारी किया है जिसे WideNDepth (WND) कहा जाता है, जो तर्क करने की क्षमताओं को ज्ञान भंडारण से अलग करने के लिए डिज़ाइन किया गया है। मॉडल में एक "Wide भाग" होता है जो मेमोरी के रूप में काम करता है और एक "Depth भाग" होता है जो तर्ककर्ता के रूप में कार्य करता है।

media Hugging Face Forums · 10 दिन पहले · 21 बार देखा गया

प्रोग्रेसिव मॉडल ग्रोथ और ट्रान्सफॉर्मर्स के लिए ओपन हार्डवेयर प्रोफाइल का प्रस्ताव

Hugging Face पर एक प्रस्ताव AI में दो जुड़े हुए समस्याओं पर चर्चा करता है: अलग-अलग बड़े मॉडल के प्रशिक्षण पर निर्भरता और इकोसिस्टम की सामान्य उद्देश्य GPU पर निर्भरता।

media Hugging Face Forums · 11 दिन पहले · 19 बार देखा गया

प्रस्ताव: एक स्थिर 4B मॉडल के लिए Qwen 9B से 27B तक क्रमिक ज्ञान स्थानांतरण

Hugging Face फोरम पर एक उपयोगकर्ता ने क्रमिक ज्ञान स्थानांतरण में एक प्रयोग का प्रस्ताव रखा है, जहां एक स्थिर-आकार का छात्र मॉडल (Qwen 4B) सबसे बड़े उपलब्ध स्रोत से सीधे सीखने के बजाय बढ़ते आकार के शिक्षक मॉडलों से क्रमिक रूप से सीखता है।

media MarkTechPost · 13 दिन पहले · 23 बार देखा गया

OpenAI ने 3 समीक्षा पथों के साथ मॉडल असंरेखण अनावरण ढांचा जारी किया

OpenAI ने अपने मॉडलों में असंरेखण को ट्रैक करने, जांचने और अनावरण करने के लिए एक नया ढांचा पेश किया है, जिसके साथ पुनर्बल सीखन प्रशिक्षण से छह विस्तृत घटना रिपोर्ट शामिल हैं। यह प्रणाली सार्वजनिक अनावरण के लिए विशिष्ट मानदंड और समयसीमा स्थापित करती है, यहाँ तक कि जब व्यवहार पूरी तरह से समझाया या कम नहीं किया गया हो।

media Hugging Face Forums · 14 दिन पहले · 21 बार देखा गया

ByteLex टोकनाइज़र मैप का उपयोग करके बाइट-मॉडल त्रुटियों की भविष्यवाणी और सुधार करता है

ByteLex के शोधकर्ताओं ने 11 टोकनाइज़र शब्दावलियों से एक निर्देशांक स्थान बनाया ताकि यह भविष्यवाणी कर सकें कि उनका बाइट-स्तरीय भाषा मॉडल किस काल्पनिक शब्द पर विफल होगा। मैप ने मॉडल की मापी गई प्रति-शब्द सटीकता के साथ -0.98 का स्पीयरमैन सहसंबंध प्राप्त किया, जो कॉर्पस से व्युत्पन्न सांख्यिकी से बेहतर है।

arxiv arXiv cs.LG · 15 दिन पहले · 28 बार देखा गया

OpenAI ने पूरी तरह से ऑडिट करने योग्य ट्रेनिंग रन के साथ Open-1B जारी किया

OpenAI ने Open-1B जारी किया है, एक भाषा मॉडल जिसे ऐसे नियम में प्रशिक्षित किया गया है जहाँ प्रशिक्षण के दौरान हर ऑपरेशन विषम कम्प्यूटिंग हार्डवेयर पर बिट-स्तर की सटीकता के साथ स्वतंत्र रूप से पुनरुत्पादित हो सकता है। यह दृष्टिकोण ओपन-सोर्स मॉडलों में निहित पुनरुत्पादन की समस्याओं को GPU kernel reductions और डेटा बैच ऑर्डरिंग जैसे नॉन-डिटरमिनिज्म स्रोतों पर एक निश्चित क्रम लागू करके हल करता है।