स्रोत · arXiv cs.CL
arxiv arXiv cs.CL · 28 दिन पहले · 35 बार देखा गया

NVIDIA के Nemotron-3 मॉडल IOI कोडिंग प्रतियोगिताओं में स्वर्ण पदक स्तर की प्रदर्शन प्राप्त करते हैं

NVIDIA ने प्रतिस्पर्धी प्रोग्रामिंग में उत्कृष्टता हासिल करने के लिए अपने Nemotron-3-Nano-CC और Nemotron-3-Ultra-CC भाषा मॉडल के लिए पोस्ट-ट्रेनिंग पाइपलाइन विकसित की है। बड़े पैमाने पर समस्याओं का चयन, संश्लेषित तर्क ट्रेस, सुपरवाइज्ड फाइन-ट्यूनिंग और रीइंफोर्समेंट लर्निंग को जोड़कर, टीम ने उच्च स्तरीय एल्गोरिदमिक तर्क करने में सक्षम विशेष प्रणालियाँ बनाई हैं।

arxiv arXiv cs.CL · 17 घंटे पहले · 1 बार देखा गया

संदर्भ भाषा मॉडल संदर्भ को संपादन योग्य फ़ाइलों के रूप में स्वतः प्रबंधित करते हैं

शोधकर्ताओं ने संदर्भ भाषा मॉडल (CLMs) का परिचय दिया है, जो एक नई आर्किटेक्चर है जो मॉडल के संदर्भ विंडो को एक संपादन योग्य फ़ाइल के रूप में मानती है, जिससे मॉडल अपने स्मृति में बिना किसी प्रतिबंध के अद्यतन कर सकता है। यह दृष्टिकोण संदर्भ प्रबंधन को बाहरी हार्नेस नियंत्रण से आंतरिक मॉडल व्यवहार की ओर स्थानांतरित करता है, जिससे संदर्भ-प्रबंधन रणनीतियों का संदर्भ-में और पैरामीट्रिक सीखना संभव होता है।

arxiv arXiv cs.CL · 2 दिन पहले · 1 बार देखा गया

अध्ययन से बहु-चरण LLM दूषण में ज्ञान नीति का विचलन सामने आया

"बहु-चरण LLM दूषण में ज्ञान नीति का विचलन: एक प्रोटोकॉल-ग्रेडिएंट जांच" शीर्षक का एक अध्ययन इस बात का मूल्यांकन करता है कि बड़े भाषा मॉडल संवाद इतिहास में डाले गए झूठे पूर्वधारणाओं को कैसे संभालते हैं, जिसे सत्र-स्तर दूषण कहा जाता है। शोधकर्ताओं ने तापमान शून्य पर 22,500 चरणों का उपयोग करते हुए GPT-5.4 Mini, Gemini-3.1 Flash-Lite, और GLM-4.5-Air का दस ज्ञान क्षेत्रों में परीक्षण किया।

arxiv arXiv cs.CL · 2 दिन पहले SWE-bench Verified · 49.2% · 1 बार देखा गया

ROFT स्व-उत्पन्न व्याख्याओं पर फाइन-ट्यून करके एजेंटिक मॉडलों को बेहतर बनाता है

शोधकर्ता रेट्रोस्पेक्शन-ओनली फाइन-ट्यूनिंग (ROFT) की जांच कर रहे हैं, जो एक न्यूनतम ऑनलाइन प्रक्रिया है जहाँ एक एजेंट अपने अनुभवों की पश्चातवृत्ति व्याख्याएँ उत्पन्न करता है और केवल उन व्याख्या टोकनों पर अगले-टोकन पूर्वानुमान हानि का उपयोग करके फाइन-ट्यून किया जाता है। इस विधि को किसी बाहरी शिक्षक या पुरस्कार-आधारित नीति अपडेट की आवश्यकता नहीं है।

arxiv arXiv cs.CL · 2 दिन पहले · 1 बार देखा गया

TokenProbe सटीकता को बनाए रखते हुए CoT टोकन उपयोग को 76% कम करता है

शोधकर्ताओं ने TokenProbe प्रस्तुत किया, जो Chain-of-Thought तर्क के उच्च टोकन उपभोग को हल करने वाले एक फ्रेमवर्क को दर्शाता है, जो तर्क ट्रैस के भीतर टोकन के गैर-समान मूल्य का लाभ उठाता है। विधि सामान्यीकृत लॉग प्रायिकता संकेतों का उपयोग करके निर्णायक सामग्री ले जाने वाले कोर टोकन और अनावश्यक फिलर के बीच अंतर करती है।

arxiv arXiv cs.CL · 2 दिन पहले · 1 बार देखा गया

Rep2Act नए VAD-R बेंचमार्क पर नई प्रश्नों से बचने की क्षमता को बेहतर बनाने के लिए VLM निरूपणों को संरेखित करता है

शोधकर्ताओं ने Visual Answerability Diagnosis with Rationales (VAD-R) का परिचय दिया, एक नया बेंचमार्क जो दृश्य-भाषा मॉडलों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है कि वे शॉर्टकट संकेतों के बिना उत्तर देने योग्य नहीं होने वाले प्रश्नों से कैसे बचते हैं। अध्ययन से पता चलता है कि छिपी हुई अवस्थाएँ उत्तर देने की क्षमता को अलग कर सकती हैं, लेकिन वर्तमान मॉडल इसे स्पष्ट निर्णयों में परिवर्तित करने में विफल रहते हैं।

arxiv arXiv cs.CL · 3 दिन पहले · 6 बार देखा गया

Highlight-Then-Summarize लंबे संदर्भ की बेहतर समझ के लिए प्रमाण को संपीड़ित करता है

शोधकर्ताओं ने Highlight-Then-Summarize (H2S) का प्रस्ताव रखा, जो एक compress-then-reason परिप्रेक्ष्य है जो प्रश्न-संबंधी प्रमाण की पहचान करता है और उत्तर उत्पन्न करने से पहले उसे एक संक्षिप्त सारांश में एकीकृत करता है। इस दृष्टिकोण का समर्थन करने के लिए, टीम ने 11 बेंचमार्क परिवारों से 6,647 उदाहरणों के साथ H2S-Dataset तैयार किया और प्रक्रिया-स्तर के पुरस्कारों के लिए H2S-RL पेश किया।

arxiv arXiv cs.CL · 3 दिन पहले · 7 बार देखा गया

पुराने दस्तावेज़ों का विषाक्तकरण पुरानी पुनर्प्राप्ति को सही मॉडल उत्तरों पर हावी बना देता है

शोधकर्ताओं ने "स्टेल-डॉक्यूमेंट पॉइजनिंग" की पहचान की, जो रेट्रीवल-एम्बेडेड जनरेशन (RAG) में एक समयिक संरेखण विफलता है, जहां पुराना बाहरी प्रमाण मॉडलों को गलत उत्तर देने पर मजबूर करता है, भले ही वे बिना पुनर्प्राप्ति के सही उत्तर जानते हों।

arxiv arXiv cs.CL · 3 दिन पहले · 7 बार देखा गया

KuaFu अरब स्केल पर उपयोगकर्ता व्यवहार को समझ में संपीड़ित करता है

Tencent ने KuaFu पेश किया, एक एकीकृत व्यवहार-संपीड़न परत जो कच्चे उपयोगकर्ता इतिहास को संवादात्मक एजेंट्स और सिफारिशकर्ताओं के लिए संपीड़ित निरूपण में बदल देती है। सिस्टम प्रत्येक व्यवधान आइटम को 128-256 चौड़ाई के 2-4 टोकन में संपीड़ित करने के लिए दो-अक्ष प्रोजेक्टर का उपयोग करता है, एक अरब उपयोगकर्ताओं के लिए लंबी अनुक्रमों के प्रसंस्करण में बाधाओं को दूर करता है।

arxiv arXiv cs.CL · 6 दिन पहले · 9 बार देखा गया

कोरूटीन-ब्रिज हार्नेस ने CAR-bench ट्रैक 2 में 60.0% Pass^3 के साथ जीत हासिल की

टूल-यूज़िंग एजेंट्स के लिए एक नया कोरूटीन-ब्रिज हार्नेस ने CAR-bench मूल्यांकन के ट्रैक 2 में जीत हासिल की, आधिकारिक छिपे हुए टेस्ट सेट पर 60.0% Pass@3 स्कोर प्राप्त किया। सिस्टम मॉडल इन्वोकेशन को टूल राउंड-ट्रिप्स से अलग करता है, जिसमें मॉडल पायथन प्रोग्राम उत्पन्न करता है जो एvaluator आदान-प्रदान के दौरान ब्लॉक और रीज्यूम होते हैं।

arxiv arXiv cs.CL · 7 दिन पहले · 6 बार देखा गया

R3Con बड़े पैमाने के तर्क को बेहतर बनाने के लिए प्रासंगिकता साकारकरण सिद्धांतों को लागू करता है

शोधकर्ताओं ने R3Con का प्रस्ताव रखा है, जो बहुत बड़े संदर्भों की प्रभावी प्रतिनिधित्व बनाने के लिए संज्ञानात्मक सिद्धांत के सिद्धांतों को क्रियान्वित करता है। यह प्रणाली मानक मॉडल संदर्भ सीमाओं से परे विशाल स्रोतों में बिखरी हुई अंतर्निर्भर जानकारी को जोड़ने की चुनौती को संबोधित करती है।

arxiv arXiv cs.CL · 7 दिन पहले · 8 बार देखा गया

VHD-Play हल किए गए तंत्रों से एजेंटिक RL पर्यावरण उत्पन्न करता है

VHD-Play एक पाइपलाइन है जो गणितीय मॉडलों को सैंपल और हल करने के बाद उनके निर्णय प्रक्रियाओं को स्टेटफुल टूल्स के रूप में रेंडर करके विविध एजेंटिक रिइन्फोर्समेंट लर्निंग पर्यावरण उत्पन्न करता है। यह दृष्टिकोण सुनिश्चित करता है कि निष्पादन योग्य गतिशीलता और ट्राजेक्टरी-स्कोरिंग संदर्भ सीधे हल किए गए मॉडल से विरासत में मिलें, जो मौजूदा जनरेशन पाइपलाइनों में सामान्य असंगति समस्याओं को दूर करता है।

arxiv arXiv cs.CL · 7 दिन पहले · 2 बार देखा गया

WebMRE बेंचमार्क वेब एजेंट्स में गाइड-एक्शन पारस्परिक पुनर्बलन को उजागर करता है

लेखकों ने WebMRE का परिचय दिया, जो 541 कार्यों और 5,293 चरणों का एक ऑफलाइन बेंचमार्क है, जो सफल WebArena ट्राजेक्टरी से व्युत्पन्न है, जिसका उद्देश्य पर्यावरण विचलन के बिना वेब एजेंट चेकपॉइंट्स को स्कोर करने के लिए एक निर्धारक प्रोटोकॉल प्रदान करना है। यह फ्रेमवर्क मानव-उन्मुख गाइड वाक्यों को भूमिगत कार्यों के साथ जोड़ता है ताकि उनके बीच पारस्परिक पुनर्बलन प्रभाव का अध्ययन किया जा सके।

arxiv arXiv cs.CL · 7 दिन पहले SWE-Lancer · 51.47% · 10 बार देखा गया

SkillGym मानवीय कौशल को LLMs में एकीकृत करता है ताकि वास्तविक दुनिया की समस्याओं का समाधान किया जा सके

शोधकर्ताओं ने SkillGym पेश किया, एक फ्रेमवर्क जो मानव-लेखित एजेंट कौशल को बड़े भाषा मॉडल एजेंट्स के लिए निष्पादन योग्य और सत्यापन योग्य प्रशिक्षण वातावरणों में परिवर्तित करता है। सिस्टम एक skill-to-task पाइपलाइन का उपयोग करके ठोस कार्यों को तैनात करता है और कोड-आधारित चेकरों के साथ परिणामों की पुष्टि करता है।

arxiv arXiv cs.CL · 8 दिन पहले · 22 बार देखा गया

Agensh संगठनात्मक बुद्धिमत्ता को 1,024 एजेंट्स तक स्केल करता है

शोधकर्ताओं ने Agensh का परिचय दिया, एक स्केलेबल स्व-संगठित मल्टी-एजेंट हार्नेस जो समवर्ती कार्यकर्ताओं को उप-कार्यों को असिंक्रोनस रूप से दावा करने और प्रगति को विलय करने की अनुमति देकर केंद्रीय ऑर्केस्ट्रेटर बॉटलनेक को समाप्त करता है।

arxiv arXiv cs.CL · 8 दिन पहले · 19 बार देखा गया

TelecomGPT-R1: विविध टेलीकॉम कार्यों में तर्क के लिए एकीकृत पोस्ट-ट्रेनिंग

शोधकर्ताओं ने TelecomGPT-R1 का परिचय दिया है, जो एक खुला-स्रोत एकीकृत टेलीकॉम तर्क मॉडल परिवार है, जो मानकों, कॉन्फ़िगरेशन और लॉग पर तर्क करके इंजीनियरिंग कार्यों को स्वचालित करने के लिए डिज़ाइन किया गया है। यह मॉडल प्रोटोकॉल, ज्ञान, मॉडलिंग और दोष अक्षों को कवर करने वाले एक संरचित दृष्टिकोण के माध्यम से मौजूदा सामान्य-उद्देश्य और विशेष LLMs की सीमाओं को दूर करता है।

arxiv arXiv cs.CL · 8 दिन पहले · 19 बार देखा गया

Qwen ने Qwen3.8-Omni-Flash जारी किया, जो 1M टोकन संदर्भ के साथ एक स्थानीय बहुआयामी एजेंटिक मॉडल है

Alibaba Cloud ने Qwen3.8-Omni-Flash का परिचय दिया, जो एक स्वदेशी बहुआयामी एजेंटिक मॉडल है जो वास्तविक दुनिया की उत्पादकता कार्यों के लिए डिज़ाइन किया गया है और पिछले omni मॉडलों की तुलना में बहुआयमी समझ और तर्कशीलता को काफी बेहतर बनाता है।

arxiv arXiv cs.CL · 9 दिन पहले HealthBench · 50.1% · 14 बार देखा गया

Fathom-Vaidya रूब्रिक-आधारित पुरस्कारों के साथ चिकित्सा तर्क को बेहतर बनाता है

लेखकों ने Fathom-Vaidya का परिचय दिया, जो 30B पैरामीटर वाला एक मॉडल है जो सिंथेटिक डेटा और रूब्रिक-आधारित रीइन्फोर्समेंट लर्निंग का उपयोग करके नैदानिक और क्लिनिकल हेल्थकेयर तर्क को बढ़ावा देता है।

arxiv arXiv cs.CL · 9 दिन पहले · 15 बार देखा गया

एजेंटरूटर स्तर-स्तरीय मॉडल रूटिंग के माध्यम से एजेंटिक वर्कफ़्लो लागत को 72% तक कम करता है

शोधकर्ताओं ने एजेंटरूटर प्रस्तावित किया, जो एक हल्का क्लासिफायर है जो बहु-चरण एजेंटिक वर्कफ़्लो को अनुकूलित करता है, व्यक्तिगत ट्रैजेक्टरी चरणों को उचित मॉडल टियर में रूट करके, न कि सभी कार्यों के लिए एकल फ्रंटियर मॉडल का उपयोग करके। यह सिस्टम उन एंटरप्राइज सिस्टम की अक्षमता को दूर करता है जो छोटे मॉडल समान रूप से संभाल सकते हैं, ऐसे सबटास्क्स पर अपनी इनफरेंस बजट के 60-80% को व्यर्थ करते हैं।

arxiv arXiv cs.CL · 10 दिन पहले · 17 बार देखा गया

NemotronLabs ने VoiceChat जारी किया, जो टूल कॉलिंग के साथ एक खुला पूर्ण-द्विदिशीय स्पीच-टू-स्पीच मॉडल है

NemotronLabs ने VoiceChat का परिचय दिया, जो एक खुले वजन वाला पूर्ण-द्विदिशीय स्पीच-टू-स्पीच मॉडल है जिसे एक एकीकृत स्ट्रीमिंग आर्किटेक्चर के भीतर सुनने, ट्रांसक्रिप्शन, तर्क और बोलने को एकीकृत करने के लिए डिज़ाइन किया गया है। सिस्टम में एक स्ट्रीमिंग स्पीच एन्कोडर और डिकोडर-केवल भाषा मॉडल का संयोजन शामिल है, जिसमें एजेंट टेक्स्ट और संरचित फ़ंक्शन कॉल्स के लिए समानांतर विशेष आउटपुट स्ट्रीम्स हैं, साथ ही एक सहायक RNN-T शाखा है जो क्रमिक उपयोगकर्ता ट्रांसक्रिप्शन के लिए है।