स्रोत · arXiv cs.LG
arxiv arXiv cs.LG · 28 दिन पहले · 73 बार देखा गया

NVIDIA Nemotron-3 मॉडल्स ने IOI 2026 में स्वर्ण पदक और शीर्ष मानव स्कोर हासिल किए

शोधकर्ताओं ने बड़े भाषा मॉडल्स के लिए एक पोस्ट-ट्रेनिंग पाइपलाइन विकसित की है जो उन्हें प्रतिस्पर्धी प्रोग्रामिंग में स्वर्ण पदक स्तर का प्रदर्शन करने में सक्षम बनाती है। सुपरवाइज्ड फाइन-ट्यूनिंग, रीइंफोर्समेंट लर्निंग और GenCorrect नामक एक नई फीडबैक-ड्रिवन रणनीति को जोड़कर, यह प्रणाली IOI 2026 समस्या सेट पर शीर्ष मानव प्रतिभागीओं से बेहतर प्रदर्शन करती है।

arxiv arXiv cs.LG · 6 दिन पहले · 7 बार देखा गया

GRASP फ्रेमवर्क मल्टी-स्टेज एजेंटिक AI के साथ रणनीतिक योजना को बेहतर बनाता है

शोधकर्ताओं ने GRASP का परिचय दिया, जो एक रणनीति-जागरूक, मल्टी-स्टेज प्लानिंग फ्रेमवर्क है जिसे जटिल कार्यों के लिए उच्च-गुणवत्ता वाले प्राकृतिक भाषा निष्पादन योग्य योजनाएं उत्पन्न करने के लिए डिज़ाइन किया गया है, जिसमें पाइपलाइन को विशेष मॉड्यूल में अलग किया जाता है। सिस्टम GenPlan के माध्यम से वैश्विक मैक्रो-गाइडलाइन्स को पूर्व-कंपाइल करता है, RevPlan के माध्यम से स्थानीय रणनीतियों का अन्वेषण करता है, और VerPlan नामक एक मल्टी-क्राइटिरिया डिस्क्रिमिनेटर का उपयोग करके ट्राजेक्टरी का मूल्यांकन करता है।

arxiv arXiv cs.LG · 8 दिन पहले · 22 बार देखा गया

AIDE^2 एआई शोध एजेंट्स के पुनरावर्ती स्वयं-सुधार को सक्षम बनाता है

शोधकर्ताओं ने AIDE^2 प्रस्तुत किया, एक सिस्टम जो अपने स्वयं के कोड को अनुकूलित करके एक फ्रंटियर एआई शोध एजेंट के लिए पुनरावर्ती स्वयं-सुधार की लूप लागू करता है। सिस्टम अपने आंतरिक तर्क में परिवर्तन सुझाता है, एआई R&D कार्यों पर संशोधित संस्करणों का बेंचमार्किंग करता है, और केवल उन अपडेट्स को ही बनाए रखता है जो छिपे हुए मूल्यांकनों पर सबसे अच्छा प्रदर्शन करते हैं।

arxiv arXiv cs.LG · 8 दिन पहले · 21 बार देखा गया

क्लिफकंपैक्शन लंबे-अवधि कोडिंग एजेंट के खर्चों को 50% तक कम करता है, प्रदर्शन बनाए रखते हुए

शोधकर्ताओं ने क्लिफकंपैक्शन पेश किया, एक ऑटोकंपैक्शन तकनीक जो लाखों टोकन संभालने वाले एजेंट्स के लिए डिज़ाइन की गई है, जो सीमित संदर्भ में खर्चों को 50% तक कम करती है। विधि टर्मिनल-बेंच पर प्रदर्शन बनाए रखती या सुधारती है और पुनः वर्णन करने के बजाय जानकारी को सटीक रखकर कर्नेलबेंच पर शीर्ष स्तर का परिणाम प्राप्त करती है।

arxiv arXiv cs.LG · 9 दिन पहले HealthBench · 50.1% · 13 बार देखा गया

Fathom-Vaidya रूब्रिक-आधारित पुरस्कारों के साथ चिकित्सा तर्क को बेहतर बनाता है

लेखकों ने Fathom-Vaidya का परिचय दिया, जो 30B पैरामीटर वाला एक मॉडल है जो संज्ञानात्मक और क्लिनिकल हेल्थकेयर तर्क को बढ़ाने के लिए सिंथेटिक डेटा और रूब्रिक-आधारित पुनर्बल सीखने का उपयोग करता है। प्रशिक्षण ढांचा पहले निदान के लिए MedBullets से प्राप्त प्रश्नों पर नियम-निर्देशित RL लागू करता है, फिर इंटरैक्टिव क्लिनिकल कार्यों के लिए बहु-आयामी रूब्रिक्स के साथ 5.3k सिंथेटिक मल्टी-टर्न परिदृश्यों का उपयोग करता है।

arxiv arXiv cs.LG · 15 दिन पहले · 28 बार देखा गया

OpenAI ने पूरी तरह से ऑडिट करने योग्य ट्रेनिंग रन के साथ Open-1B जारी किया

OpenAI ने Open-1B जारी किया है, एक भाषा मॉडल जिसे ऐसे नियम में प्रशिक्षित किया गया है जहाँ प्रशिक्षण के दौरान हर ऑपरेशन विषम कम्प्यूटिंग हार्डवेयर पर बिट-स्तर की सटीकता के साथ स्वतंत्र रूप से पुनरुत्पादित हो सकता है। यह दृष्टिकोण ओपन-सोर्स मॉडलों में निहित पुनरुत्पादन की समस्याओं को GPU kernel reductions और डेटा बैच ऑर्डरिंग जैसे नॉन-डिटरमिनिज्म स्रोतों पर एक निश्चित क्रम लागू करके हल करता है।

arxiv arXiv cs.LG · 16 दिन पहले Codeforces (Elo) · 98.2% · 29 बार देखा गया

स्टेलर कोलिसियम: लॉग-होराइजन गणित और TCS शोध के लिए मल्टी-एजेंट हैर्नेस

लेखकों ने स्टेलर कोलिसियम का परिचय दिया है, जो एक मॉडल-अग्नोस्टिक हैर्नेस है जिसे गणित और सैद्धांतिक कंप्यूटर विज्ञान में लॉग-होराइजन शोध के लिए इनफरेंस को आवंटित करने के लिए डिज़ाइन किया गया है। सिस्टम प्रूफ निर्माण से पहले वैकल्पिक रणनीतियों का अन्वेषण करता है, एक तैयारी गेट का उपयोग करता है यह निर्धारित करने के लिए कि कोई मार्ग विघटन के लिए पर्याप्त परिपक्व है या नहीं, और प्रूफ योजना को आपसी निर्भर खंड-स्तर की उपसमस्याओं के रूप में दर्शाता है।

arxiv arXiv cs.LG · 20 दिन पहले · 34 बार देखा गया

Vidu S2 ने रियल-टाइम इंटरैक्टिव अवतार और एडिटिंग मॉडल पेश किए

Vidu S2 में Vidu S2-Avatar, एक रियल-टाइम इंटरैक्टिव डिजिटल-कैरेक्टर मॉडल, और Vidu S2-Editing, एक रियल-टाइम वीडियो एडिटिंग मॉडल शामिल हैं। सिस्टम दोनों घटकों के लिए रियल-टाइम स्पेशियल वीडियो जनरेशन की संभावना का भी अन्वेषण करता है।

arxiv arXiv cs.LG · 22 दिन पहले · 28 बार देखा गया

TontaubeV1 सीमित संदर्भ के साथ स्ट्रीमिंग टेक्स्ट-टू-स्पीच को सक्षम बनाता है

शोधकर्ताओं ने TontaubeV1 प्रस्तुत किया, जो एक प्राकृतिक ध्वनिछटा (prosody) को बनाए रखने वाला टेक्स्ट-टू-स्पीच मॉडल है और एक ही उपभोक्ता GPU से स्ट्रीमिंग इनफरेंस को सक्षम बनाता है। सिस्टम 12.5 Hz पर हियरार्किकल DualCodec प्रतिनिधित्व का उपयोग करता है ताकि अर्थपूर्ण धाराओं (semantic streams) को एकाउस्टिक रिफाइनमेंट्स से अलग किया जा सके, जिससे कम लेटेन्सी जनरेशन संभव होता है।

arxiv arXiv cs.LG · 24 दिन पहले · 33 बार देखा गया

स्पेकुलेटिव्ह अनसर्टेंटी विधि ड्राफ्ट-मॉडल गेटिंग का उपयोग करके सॉफ्टवेयर इंजीनियरिंग एजेंट त्रुटियों को कम करती है

लेखकों ने स्पेकुलेटिव्ह अनसर्टेंटी (SU) प्रस्तुत किया, एक तकनीक जो लॉगिट्स, वेट्स या एक्टिवेशन तक पहुंच की आवश्यकता के बिना केवल उनके आउटपुट टोकन का विश्लेषण करके ब्लैक-बॉक्स LLM एजेंट्स के लिए एक भविष्यसूचक विफलता सिग्नल को पुनः प्राप्त करती है। स्पेकुलेटिव्ह डिकोडिंग को उल्टा करके, एक छोटा ओपन-वेट ड्राफ्ट मॉडल एजेंट के ट्रेजेक्टरी का स्कोरिंग एकल फॉरवर्ड पास में करता है ताकि फेज-अवेयर फीचर्स निकाले जा सकें और उन्हें एक सत्यापनीय उद्देश्य के खिलाफ कैलिब्रेट किया जा सके।

arxiv arXiv cs.LG · 27 दिन पहले · 51 बार देखा गया

FlashAttention-4 ने हार्डवेयर-अware FP4 इनफरेंस और ट्रेनिंग के लिए Direct-P पेश किया

FlashAttention-4 नॉनकॉजुअल इनफरेंस और काज़ुअल ट्रेनिंग के लिए नए मार्गों को पेश करके Blackwell के 4-बिट फ्लोटिंग-पॉइंट (FP4) टेन्सर कोर्स की प्रदर्शन सीमाओं को दूर करता है। Direct-P नामक यह विधि स्कोर को सीधे FP4 प्रायिकताओं में मैप करती है, ताकि सॉफ्टमैक्स रूपांतरण ओवरहेड से बचा जा सके जो आमतौर पर मैट्रिक्स गुणा छोटे होने पर प्रमुख हो जाते हैं।

arxiv arXiv cs.LG · 29 दिन पहले SWE-bench Verified · 16.6% · 42 बार देखा गया

CANOPY के साथ Qwen3-14B ने outcome-only RL का उपयोग करके AppWorld में शीर्ष स्थान हासिल किया

यह पेपर CANOPY (Coverage-ANchored On-PolicY RL) को पेश करता है, एक प्रोटोकॉल जो छोटे खुले मॉडल्स के लिए लंबे समय तक चलने वाले रीइंफोर्समेंट लर्निंग में सिग्नल की कमी और पॉलिसी ड्रिफ्ट से निपटता है। समान-कार्य अन्वेषण को बढ़ावा देकर और अपडेट्स को KL-अंकित रखकर, यह विधि एजेंटों को केवल कार्य के अंत की सत्यापन से प्रभावी ढंग से सीखने की अनुमति देती है।