स्रोत · arXiv cs.LG
arxiv arXiv cs.LG · 18 दिन पहले · 3 बार देखा गया

मूनशॉट एआई ने 2.8T पैरामीटर वाले MoE मॉडल किमी K3 को लाख-टोकन संदर्भ के साथ जारी किया

मूनशॉट एआई ने किमी K3 का परिचय दिया, जो एक ओपन-सोर्स मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल है जिसमें कुल 2.8 ट्रिलियन पैरामीटर और प्रति टोकन 104 अरब सक्रिय पैरामीटर हैं। यह मॉडल नेटिव विज़न क्षमताओं और 1-लाख-टोकन संदर्भ खिड़की का समर्थन करता है, अपने पूर्ववर्ती किमी K2 की तुलना में लगभग 2.5x स्केलिंग दक्षता प्राप्त करने के लिए किमी डेल्टा एटेंशन और स्टेबल लैटेंटMoE का लाभ उठाता है।

arxiv arXiv cs.LG · 17 घंटे पहले · 1 बार देखा गया

Faraday 27B ने कागजात प्रतिकृति कार्यों में Claude Opus 4.8 और GPT-5.5 को पछाड़ दिया

शोधकर्ताओं ने विश्वसनीय वैज्ञानिक ज्ञान की आवश्यकता को पूरा करने के लिए Replica विकसित किया है, जो कागजात प्रतिकृति के लिए एक स्केलेबल कार्य स्थान है। उन्होंने इस वातावरण का लाभ उठाने के लिए Faraday का पोस्ट-ट्रेनिंग किया, जो 27B-पैरामीटर "AI Scientist" एजेंट है और कोडिंग एजेंट्स को टूल के रूप में उपयोग करता है।

arxiv arXiv cs.LG · 17 घंटे पहले · 1 बार देखा गया

Intern-S2-Preview: वैज्ञानिक एजेंटिक फाउंडेशन मॉडल

लेखकों ने Intern-S2-Preview प्रस्तुत किया है, जो बहुआयामी वैज्ञानिक समझ, तर्कशक्ति, उत्पादन और दीर्घकालिक कार्यों का समर्थन करने के लिए डिज़ाइन किए गए वैज्ञानिक एजेंटिक फाउंडेशन मॉडलों की एक श्रृंखला है। प्रशिक्षण पाइपलाइन रेंडर किए गए वैज्ञानिक दस्तावेज़ों, अंतर्भेदित छवि-पाठ डेटा और विविध वैज्ञानिक संकलनों पर वैज्ञानिक बहुआयामी पूर्व-प्रशिक्षण के साथ शुरू होती है।

arxiv arXiv cs.LG · 2 दिन पहले HealthBench · 51.9% · 5 बार देखा गया

HealthBench पर VITA क्लिनिकल RAG सिस्टम फ्रंटियर LLMs के बराबर या बेहतर है

कम और मध्यम आय वाले सेटिंग्स के लिए डिज़ाइन किया गया एक उद्देश्य-निर्मित पुनर्प्राप्ति-वर्धित जनरेशन (RAG) सिस्टम जिसका नाम VITA है, को HealthBench बेंचमार्क पर सामान्य-उद्देश्य वाले बड़े भाषा मॉडल्स के खिलाफ आंकलन किया गया। GPT-4.1 जज द्वारा स्कोर किए गए 4,023 प्रश्नों पर, VITA ने संभावित रूब्रिक अंकों में से 51.9% के साथ पहले स्थान पर रहे, जिसमें GPT-5.4, o4-mini, Gemini 3.1 Pro और Claude Sonnet 4.6 को पीछे छोड़ दिया।

arxiv arXiv cs.LG · 4 दिन पहले · 2 बार देखा गया

Macaron-V1 ने Mixture-of-LoRA के साथ निरंतर सीखने के लिए खुला एजेंट-मॉडल परिवार पेश किया

Macaron-V1 एक खुला एजेंट-मॉडल परिवार है जो अनुभवजन्य बुद्धिमत्ता के लिए डिज़ाइन किया गया है, जो वास्तविक पर्यावरण से सीखने और तैनाती के बाद भी सीखते रहने में सक्षम बनाता है। सिस्टम दो लक्ष्यों पर केंद्रित है: मॉडल-हार्नेस जोड़ों के पुनरावर्ती सुधार के माध्यम से अनुकूलन और प्रति उपयोगकर्ता पाले विशेषज्ञ LoRA एडेप्टर्स का चयन करने वाली Mixture-of-LoRA (MoL) आर्किटेक्चर के माध्यम से सहयोग।

arxiv arXiv cs.LG · 4 दिन पहले · 11 बार देखा गया

शोधकर्ता क्रॉस-सेशन एन्क्रिप्शन पुन: उपयोग का लाभ उठाकर LLM API से तर्क ट्रेस चुराते हैं

शोधकर्ताओं ने प्रमुख बड़े भाषा मॉडल प्रदाताओं द्वारा स्टेप-बाय-स्टेप तर्क ट्रेस को कैसे संभाला जाता है, इसमें एक कमजोरी की पहचान की है, जिसे क्लाइंट-साइड उपयोग के लिए एन्क्रिप्टेड ब्लॉक के रूप में वापस किया जाता है। उन्होंने पाया कि ये एन्क्रिप्टेड ब्लॉक प्रदाता के ही पारिस्थितिकी तंत्र के भीतर विभिन्न सेशनों, उपयोगकर्ताओं और मॉडल के बीच पूरी तरह से संगत और अदला-बदली योग्य हैं।

arxiv arXiv cs.LG · 8 दिन पहले

U-OPSD LLMs के लिए अनसुपervised ऑन-पॉलिसी सेल्फ-डिस्टिलेशन को सक्षम बनाता है

शोधकर्ताओं ने अनसुपervised ऑन-पॉलिसी सेल्फ-डिस्टिलेशन (U-OPSD) का प्रस्ताव रखा है, एक विधि जो बाहरी निगरानी के बिवल मॉडल की अपनी जनरेशन का उपयोग करके बड़े भाषा मॉडलों के लिए पोस्ट-ट्रेनिंग सुधार प्राप्त करती है। यह दृष्टिकोण बहुमत वोट के माध्यम से एक pseudo-समाधान बनाने के लिए कई रोलआउट्स को सैंपल करता है, फिर शिक्षक वितरण को मॉडल की सबसे लंबी गलत पूर्णता के उपसर्गों में संक्षिप्त करता है।

arxiv arXiv cs.LG · 11 दिन पहले OSWorld 2.0 · 21.2% · 20 बार देखा गया

Qwen ने 397B-A17B नैटिव कंप्यूटर-यूज़ एजेंट Qwen-CUA जारी किया

Qwen ने Qwen-CUA का परिचय दिया, जो एक 397B-A17B मिक्स्चर-ऑफ़-एक्सपर्ट्स बैकबोन पर बनाया गया नैटिव कंप्यूटर-यूज़ एजेंट है, जो DOM ट्रीज़ या एक्सेसिबिलिटी मेटाडेटा पर निर्भर किए बिना स्क्रीनशॉट और इनपुट इवेंट्स के माध्यम से काम करता है। सिस्टम 20 सक्रिय स्क्रीनशॉट तक बनाए रखने के लिए एक स्केफोल्ड का उपयोग करता है और लगभग 40,000 सत्यापनीय कार्यों पर लगभग 100,000 vCPUs वाले क्लाउड रोलआउट फ्लीट का उपयोग करके प्रशिक्षित किया गया।

arxiv arXiv cs.LG · 24 दिन पहले · 8 बार देखा गया

स्केवएडम टियर्ड ऑप्टिमाइजर स्टेट का उपयोग करके MoE प्रशिक्षण मेमोरी को 97% कम करता है

शोधकर्ताओं ने स्केवएडम पेश किया, जो मिक्चर-ऑफ-एक्सपर्ट्स (MoE) मॉडलों के लिए डिज़ाइन किया गया एक ऑप्टिमाइजर है जो अलग-अलग पैरामीटर आबादी को अलग-अलग स्टेट प्रकार आवंटित करके मेमोरी उपयोग को काफी कम करता है। बैकबोन के लिए float32 मोमेंटम और फैक्टरized सेकंड मोमेंट्स, एक्सपर्ट्स के लिए फैक्टरized सेकंड मोमेंट्स, और राउटर के लिए एक्सेक्ट सेकंड मोमेंट्स आवंटित करके, स्केवएडम 6.78B-पैरामीटर मॉडल के लिए ऑप्टिमाइजर स्टेट को 50.6 GB से 1.29 GB तक कम करता है।

arxiv arXiv cs.LG · 28 दिन पहले · 2 बार देखा गया

RoboTTT 8K-टिम्स्टेप संदर्भ के लिए रोबोट पॉलिसीज़ को स्केल करता है

शोधकर्ताओं ने RoboTTT का परिचय दिया, एक प्रशिक्षण विधि जो रोबोट फाउंडेशन मॉडल्स के लिए विसुओमोटर संदर्भ को 8,000 टिम्स्टेप्स तक बढ़ाती है बिना इनफरेंस लेटेंसी बढ़ाए। यह विधि वीजन-लैंग्वेज-एक्शन पॉलिसीज़ में टेस्ट-टाइम ट्रेनिंग को एकीकृत करती है, जिसमें ग्रेडिएंट डेसेंट के माध्यम से अपडेट किए जाने वाले फास्ट वेइट्स का उपयोग प्रशिक्षण और इनफरेंस दोनों के दौरान किया जाता है।