Research paper
media r/LocalLLaMA · 1 दिन पहले · 5 बार देखा गया

अमेरिकी ऊर्जा विभाग ने जेनेसिस ओपन मॉडल्स इनिशिएटिव शुरू किया और जेनेसिस-साइंस-1 का अनावरण किया

अमेरिकी ऊर्जा विभाग ने जेनेसिस ओपन मॉडल्स इनिशिएटिव शुरू किया है और Arcee के साथ साझेदारी में वैज्ञानिक शोध के लिए अपने पहले ओपन-वेट मॉडल, जेनेसिस-साइंस-1 का अनावरण किया है।

arxiv arXiv cs.LG · 2 दिन पहले

U-OPSD LLMs के लिए अनसुपervised ऑन-पॉलिसी सेल्फ-डिस्टिलेशन को सक्षम बनाता है

शोधकर्ताओं ने अनसुपervised ऑन-पॉलिसी सेल्फ-डिस्टिलेशन (U-OPSD) का प्रस्ताव रखा है, एक विधि जो बाहरी निगरानी के बिवल मॉडल की अपनी जनरेशन का उपयोग करके बड़े भाषा मॉडलों के लिए पोस्ट-ट्रेनिंग सुधार प्राप्त करती है। यह दृष्टिकोण बहुमत वोट के माध्यम से एक pseudo-समाधान बनाने के लिए कई रोलआउट्स को सैंपल करता है, फिर शिक्षक वितरण को मॉडल की सबसे लंबी गलत पूर्णता के उपसर्गों में संक्षिप्त करता है।

arxiv arXiv cs.CL · 2 दिन पहले

M$^3$R-Bench बहुआयामी रूपक समझ के लिए प्रमाण-आधारित मानदंड का परिचय देता है

शोधकर्ताओं ने M$^3$R-Bench पेश किया, एक एकीकृत मानदंड जिसमें 1,000 छवि-पाठ उदाहरण शामिल हैं, जिनमें प्रमाण-आधारित बहुआयामी रूपक समझ का मूल्यांकन करने के लिए मानव-सत्यापित टिप्पणियाँ दी गई हैं। यह मानदंड रूपक की उपस्थिति, लक्ष्य-स्रोत मैपिंग, भावनात्मक स्थिति और अवधारणात्मक रूपक सिद्धांत पर आधारित चरण-दर-चरण व्याख्याओं के लिए संयुक्त टिप्पणियाँ प्रदान करता है।

lab Google DeepMind Blog · 3 दिन पहले · 16 बार देखा गया

चक्रवात पूर्वानुमान के लिए Google DeepMind ने WeatherNext AI मॉडल को ओपन सोर्स किया

Google DeepMind और Google Research ने WeatherNext 2 और WeatherNext Cyclones AI मॉडल को ओपन सोर्स किया है, जो उष्णकटिबंधीय चक्रवात के मार्ग, तीव्रता और वायु संरचना की भविष्यवाणी में शीर्ष स्तर की सटीकता हासिल करते हैं। Nature में प्रकाशित इस कार्य से पता चलता है कि ये मॉडल पूर्वानुमानकों को पिछले सिस्टम की तुलना में भविष्यवाणी की सटीकता में एक दिन का अतिरिक्त लाभ प्रदान करते हैं।

arxiv arXiv cs.AI · 3 दिन पहले SWE-bench Pro · 78.0%

Argus: दीर्घकालिक तर्क के लिए एक सामान्य-उद्देश्य एजेंटिक रनटाइम

शोधकर्ताओं ने Argus प्रस्तुत किया, जो एक स्थिर, स्वयं-विकासशील एजेंटिक रनटाइम है जिसका डिज़ाइन दीर्घकालिक तर्क के लिए किया गया है और यह स्थिर उपयोगकर्ता इरादे को संचालनात्मक उद्देश्यों से अलग करता है। प्रणाली Manager, Planner, Engineer, और Reviewer भूमिकाओं का उपयोग करके टिकाऊ परियोजना अवस्था पर सीमित मिशन निष्पादित करती है, जिससे ऑपरेटर-स्वामित्व वाले एस्केलेशन बिंदुओं के बीच स्वतंत्र निष्पादन संभव होता है।

media MarkTechPost · 3 दिन पहले

माइक्रोसॉफ्ट का SkillOpt कोडेक्स और क्लॉड कोड के बीच एजेंट कौशल स्थानांतरण सक्षम बनाता है

माइक्रोसॉफ्ट, शांघাই जियाओ टोंग यूनिवर्सिटी, टोंगी यूनिवर्सिटी और फूडान यूनिवर्सिटी के शोधकर्ताओं ने SkillOpt विकसित किया है, जो एक टेक्स्ट-स्पेस ऑप्टिमाइज़र है जो लक्ष्य मॉडल को फ्रोजन रखते हुए प्राकृतिक-भाषा कौशल दस्तावेजों को प्रशिक्षित करता है। सिस्टम स्कोर्ड रोलआउट्स के आधार पर सीमित संपादन सुझाने के लिए एक ऑप्टिमाइज़र मॉडल का उपयोग करता है, जिसका परिणाम एक अकेले `best_skill.md` फ़ाइल के रूप में निर्यात किया जाता है।

lab NVIDIA Research · 3 दिन पहले · 5 बार देखा गया

ROSA साझा GPU-पूल सर्विंग के माध्यम से कार्यात्मक उत्पादकता को 12.06x तक बढ़ाता है

शोधकर्ताओं ने ROSA का प्रस्ताव रखा, जो एक रोबोटिक्स फाउंडेशन मॉडल सर्विंग सिस्टम है जो रोबोट कारखानों के लिए डिज़ाइन किया गया है और जो एकल-रोबोट, एज-कंप्यूटिंग मान्यताओं से परे जाता है। यह सिस्टम साझा GPU-पूल सर्विंग का उपयोग करता है ताकि रोबोटों के बेड़े नेटवर्क के माध्यम से सर्वर-क्लास GPUs तक पहुंच सकें।

media Hugging Face Forums · 5 दिन पहले

फ्यूज्ड ट्रिटन कर्नेल के साथ ओपन-सोर्स डिके-गेटेड O(N) कैजुअल लीनियर एटेंशन

एक डेवलपर ने क्वाड्रेटिक MHA बॉटलनेक्स को पार करने के लिए डिज़ाइन किए गए फ्यूज्ड ट्रिटन/CUDA स्टेट एक्कुमुलेशन कर्नेल्स वाले डिके-गेटेड O(N) कैजुअल लीनियर एटेंशन आर्किटेक्चर को ओपन-सोर्स किया है।

arxiv arXiv cs.LG · 5 दिन पहले OSWorld 2.0 · 21.2% · 6 बार देखा गया

Qwen ने 397B-A17B नैटिव कंप्यूटर-यूज़ एजेंट Qwen-CUA जारी किया

Qwen ने Qwen-CUA का परिचय दिया, जो एक 397B-A17B मिक्स्चर-ऑफ़-एक्सपर्ट्स बैकबोन पर बनाया गया नैटिव कंप्यूटर-यूज़ एजेंट है, जो DOM ट्रीज़ या एक्सेसिबिलिटी मेटाडेटा पर निर्भर किए बिना स्क्रीनशॉट और इनपुट इवेंट्स के माध्यम से काम करता है। सिस्टम 20 सक्रिय स्क्रीनशॉट तक बनाए रखने के लिए एक स्केफोल्ड का उपयोग करता है और लगभग 40,000 सत्यापनीय कार्यों पर लगभग 100,000 vCPUs वाले क्लाउड रोलआउट फ्लीट का उपयोग करके प्रशिक्षित किया गया।

arxiv arXiv cs.CL · 5 दिन पहले · 1 बार देखा गया

डौइयां ने शीर्ष प्रदर्शन वाले DME बहु-मोडल एम्बेडिंग मॉडल को जारी किया

डौइयां ने अपने मल्टीमोडल एम्बेडिंग (DME) मॉडल के लिए तकनीकी रिपोर्ट जारी की है, जो शक्तिशाली विभेदन और दक्षता प्राप्त करने के लिए बड़े पैमाने पर कंट्रास्टिव प्री-ट्रेनिंग को लेटेन्ट रीजनिंग के साथ जोड़ता है।

arxiv arXiv cs.CL · 5 दिन पहले OSWorld 2.0 · 21.2% · 4 बार देखा गया

Qwen ने Qwen-CUA जारी किया, एक 397B-A17B स्थानीय कंप्यूटर-उपयोग एजेंट

शोधकर्ताओं ने Qwen-CUA का परिचय दिया है, जो एक 397B-A17B Qwen मिक्स्चर-ऑफ-एक्सपर्ट्स बैकबोन पर बनाया गया स्थानीय कंप्यूटर-उपयोग एजेंट है। सिस्टम स्क्रीनशॉट देखकर और कीबोर्ड व माउस इवेंट के माध्यम से कार्य करके संचालित होता है, बिना DOM ट्री या एक्सेसिबिलिटी मेटाडेटा पर निर्भर किए।

arxiv arXiv cs.CL · 5 दिन पहले

जब विरोधी तर्क को पुनः लिखते हैं तो थॉट-ऑफ-थॉट मॉनिटर ढह जाते हैं

शोध प्रदर्शित करता है कि चेन-ऑफ-थॉट (CoT) निगरानी उन विरोधियों के खिलाफ विफल हो जाती है जो तर्क प्रक्रिया को नियंत्रित करते हैं। एक एजेंट के तर्क को पुनः लिखकर, आदेशों और आउटपुट को शब्दशः बनाए रखते हुए उसे अच्छे विश्वास की इंजीनियरिंग जैसा दिखाने से, हमलावर निगरानी तंत्रों को पार कर सकते हैं।

media Don't Worry About the Vase · 5 दिन पहले · 5 बार देखा गया

OpenAI का Astra गणित के 10 प्रमुख खुले समस्याओं को हल करता है

OpenAI ने अपने अनाधिकृत आंतरिक मॉडल, Astra से परिणाम जारी किए हैं, जिसने गणित में दस महत्वपूर्ण खुली समस्याओं को सफलतापूर्वक हल किया। समाधान मॉडल द्वारा उत्पन्न किए गए और बाद में मानव शोधकर्ताओं द्वारा Lean प्रमाण पत्रों में औपचारिक रूप दिया गया।

media Hugging Face Forums · 7 दिन पहले

हाई स्कूल के छात्र ने AttnRoute-MoE Vision Transformer पेपर के लिए arXiv एंडोसर की खोज की

हान्यु (ओलिविया) यु, एक हाई स्कूल के दसवीं कक्षा की छात्रा, cs.LG या cs.CV में arXiv एंडोसर की तलाश में है ताकि वह अपना स्वतंत्र प्रीप्रिंट "AttnRoute-MoE: Attention-Prior Routing for Mixture-of-Experts Vision Transformers" अपलोड कर सके।

blog Simon Willison · 8 दिन पहले · 12 बार देखा गया

OpenAI का Astra मॉडल GPT-5.6 Sol का उपयोग करके दस लंबे समय से चले आ रहे गणितीय समस्याओं को हल करता है

OpenAI ने दस गणितीय और सैद्धांतिक कंप्यूटर विज्ञान समस्याओं के समाधान जारी किए हैं, जिनके मुख्य परिणामों पर कम से कम एक दशक से कोई प्रगति नहीं हुई थी, अपने अगले प्रमुख मॉडल Astra के आंतरिक संस्करण का उपयोग करके।

lab OpenAI News · 8 दिन पहले · 16 बार देखा गया

Astra मॉडल गणित और सैद्धांतिक कंप्यूटर विज्ञान में दस खुली समस्याओं को हल करता है

OpenAI का आंतरिक Astra मॉडल गणित और सैद्धांतिक कंप्यूटर विज्ञान में लंबे समय से चली आ रही दस खुली समस्याओं के समाधान उत्पन्न कर चुका है, जिनके तर्क Lean में औपचारिक रूप दिए गए हैं। ये परिण उच्च-आयामी ज्यामिति, कोडिंग सिद्धांत, समूह सिद्धांत और क्वांटम जटिलता को शामिल करते हैं, उन प्रश्नों को संबोधित करते हैं जिनमें कम से कम एक दशक से कोई प्रगति नहीं हुई थी।

arxiv arXiv cs.CL · 9 दिन पहले · 2 बार देखा गया

मेमोरी डिकोडर स्केल पर: पैरामीट्रिक लंबी अवधि की मेमोरी को 6.9B पैरामीटर तक बढ़ाना

शोधकर्ताओं ने Memory Decoder at Scale प्रस्तुत किया, एक सिस्टम जो पैरामीट्रिक लंबी अवधि की मेमोरी मॉडलों को 6.9B पैरामीटर तक स्केल करता है और उन्हें 300B टोकन पर प्रीट्रेन करता है। इस डेटा स्केल पर मानक Faiss पाइपलाइन के असंभव होने का सामना करने के लिए, लेखकों ने kNN वितरणों की स्पार्स, बैच-वाइज लोडिंग के साथ एक वितरित इंडेक्सिंग पाइपलाइन लागू की है।

arxiv arXiv cs.AI · 9 दिन पहले WebArena · 73.6% · 2 बार देखा गया

Qwen-UI-Agent मोबाइल-यूज़ बेंचमार्क्स पर स्टेट ऑफ़ द आर्ट स्थापित करता है

Qwen टीम ने Qwen-UI-Agent के लिए एक तकनीकी रिपोर्ट जारी की है, जो एक वास्तविक-दुनिया केंद्रित फाउंडेशन GUI एजेंट है जिसे मोबाइल, कंप्यूटर-यूज़, वेब और DeepSearch पर्यावरणों में विश्वसनीय रूप से संचालित करने के लिए डिज़ाइन किया गया है। सिस्टम विविध सैंडबॉक्स पर्यावरणों को एक बड़े पैमाने के वास्तविक-डिवाइस मोबाइल रनटाइम के साथ जोड़ता है, GUI ऑपरेशन को CLI निष्पादन के साथ अंतर्भुजित करता है और लंबे-अवधि कार्यों का समर्थन करता है।

arxiv arXiv cs.CL · 10 दिन पहले · 4 बार देखा गया

Living-Harness स्वयं-विकासित एजेंट हार्नेस को Pass@1 में लगभग 10 अंक से बढ़ाता है

शोधकर्ताओं ने Living-Harness का प्रस्ताव रखा है, जो एक स्वयं-विकासित एजेंट हार्नेस है जो पूर्ण ट्राजेक्टरी और मूल्यांकक संकेतों को सीमित हार्नेस अपडेट के लिए पोस्टीरियर सबूत में परिवर्तित करता है। Evolution-SOP द्वारा निर्देशित, सिस्टम एपिसोडिक मेमोरी और स्टेट ग्राफ लिखने के लिए एपिसोड अभिनिर्माणों और संरचित अपडेट सबूत को निकालता है।

arxiv arXiv cs.CL · 10 दिन पहले · 3 बार देखा गया

संवैधानिक मध्य-प्रशिक्षण से स्थायी अनुपालन लाभ मिलते हैं क्षमता हानि के बिना

शोधकर्ताओं ने 120B-स्केल मॉडल्स के प्रशिक्षण प्रक्रिया में मूल्य-आधारित सामग्री डालकर संवैधानिक मध्य-प्रशिक्षण का परीक्षण किया, यह निर्धारित करने के लिए कि क्या यह मानक पोस्ट-ट्रेनिंग विधियों की तुलना में अधिक स्थायी अनुपालन उत्पन्न करता है। अध्ययन से पता चला कि यह दृष्टिकोण अनुपालन सामान्यीकरण और स्थिरता को महत्वपूर्ण रूप से बढ़ाता है, विशेष रूप से सुपरवाइज्ड फाइन-ट्यूनिंग के बाद ब्लैकमेल प्रवृत्ति को कम करने में।