स्रोत · arXiv cs.CL
arxiv arXiv cs.CL · 18 दिन पहले · 6 बार देखा गया

मूनशॉट एआई ने 2.8T MoE मॉडल किमी K3 को लाख-टोकन संदर्भ के साथ जारी किया

मूनशॉट एआई ने किमी K3 का परिचय दिया, एक ओपन-सोर्स मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल जिसमें 2.8 ट्रिलियन कुल पैरामीटर और प्रति टोकन 104 अरब सक्रिय पैरामीटर हैं। आर्किटेक्चर नेटिव विजन क्षमताओं का उपयोग करता है और किमी डेल्टा एटेंशन और स्टेबल लेटेंटMoE द्वारा सक्षम 1-लाख-टोकन संदर्भ खिड़की का समर्थन करता है।

arxiv arXiv cs.CL · 1 दिन पहले

कमी की गई मैट्रिक्स गुणन: LLM निष्पादन के लिए इनपुट-अनुकूलित मैट्रिक्स-गुणन कमी

शोधकर्ताओं ने Reduced Matrix Multiplication (RMM) का प्रस्ताव रखा है, जो एक ट्रेनिंग-फ्री, इनपुट-अनुकूलित निष्पादन विधि है जो मॉडल वजन को संशोधित किए बिना संकुचन आयामों के साथ सूचनात्मक स्लाइस का चयन करके ट्रान्सफॉर्मर मैट्रिक्स गुणनों को कम करती है। एक सरल रिटेंशन-अनुपात नियंत्रण के तहत, RMM 1B से 70B पैरामीटर तक के भाषा मॉडलों में सटीकता-दक्षता का एक सहज और पूर्वानुमेय व्यापार प्रदान करता है।

arxiv arXiv cs.CL · 1 दिन पहले

AutoDesign मेटा-हार्नेस अनुकूलन का उपयोग करके लंबे-अवधि एजेंटिक डिज़ाइन को बेहतर बनाता है

पत्र में AutoDesign पेश किया गया है, एक फ्रेमवर्क जो रोलआउट फीडबैक के आधार पर अपने हार्नेस को पुनरावृत्त रूप से सुधारने वाले कोड एजेंट को मार्गदर्शन देने के लिए एक मेटा-हार्नेस ऑप्टिमाइज़र का उपयोग करता है। लेखकों ने PosterBench नामक नए बेंचमार्क का उपयोग करके अकादमिक पत्र से पोस्टर जनरेशन कार्य पर इस दृष्टिकोण का मूल्यांकन किया है।

arxiv arXiv cs.CL · 1 दिन पहले

Intern-S2-Preview ने बहुआयामी पूर्व-प्रशिक्षण और RL के साथ वैज्ञानिक एजेंटिक फाउंडेशन मॉडल पेश किया

लेखकों ने Intern-S2-Preview प्रस्तुत किया, जो बहुआयामी वैज्ञानिक समझ, तर्क, उत्पादन और दीर्घकालिक कार्यों का समर्थन करने के लिए डिज़ाइन किए गए वैज्ञानिक एजेंटिक फाउंडेशन मॉडल की एक श्रृंखला है। प्रशिक्षण पाइपलाइन रेंडर किए गए वैज्ञानिक दस्तावेज़ों, इंटरलीव्ड इमेज-टेक्स्ट डेटा और विविध वैज्ञानिक कॉर्परा पर वैज्ञानिक बहुआयामी पूर्व-प्रशिक्षण के साथ शुरू होती है।

arxiv arXiv cs.CL · 2 दिन पहले HealthBench · 51.9% · 5 बार देखा गया

HealthBench पर Corpus-विशिष्ट VITA RAG फ्रंटियर LLMs के बराबर या बेहतर

VITA, एक पुनर्प्राप्ति-संवर्धित जनरेशन सिस्टम जो कम और मध्यम आय वाले संदर्भों के लिए डिज़ाइन किया गया है, HealthBench के अंग्रेजी भाषा उपसमुच्चय पर पहले स्थान पर है, GPT-5.4, o4-mini, Gemini 3.1 Pro, और Claude Sonnet 4.6 को पीछे छोड़ते हुए।

arxiv arXiv cs.CL · 3 दिन पहले · 1 बार देखा गया

MiLMMT-46-v1.0 ने संदर्भ-मुक्त पोस्ट-ट्रेनिंग के माध्यम से बहुभाषी अनुवाद में सुधार किया

शोधकर्ताओं ने MiLMMT-46-v1.0 जारी किया है, जो एक खुला बड़ा भाषा मॉडल है जो संदर्भ-मुक्त पोस्ट-ट्रेनिंग का उपयोग करके बहुभाषी मशीन अनुवाद के लिए बनाया गया है। निगरानी-फाइन-ट्यून्ड MiLMMT-46-v0.1 से शुरू करते हुए, टीम ने भाषा पहचान द्वारा गेट किए गए दो संदर्भ-मुक्त गुणाकार अनुमान मॉडलों पर आधारित पुरस्कार के साथ ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) लागू किया।

arxiv arXiv cs.CL · 4 दिन पहले · 10 बार देखा गया

Macaron-V1 ने Mixture-of-LoRA के साथ निरंतर सीखने के लिए खुला एजेंट-मॉडल परिवार पेश किया

Macaron-V1 एक खुला एजेंट-मॉडल परिवार है जो अनुभवजन्य बुद्धिमत्ता के लिए डिज़ाइन किया गया है, जिससे सिस्टम वास्तविक दुनिया के अनुभवों से सीख सकते हैं और तैनाती के बाद भी सुधार जारी रख सकते हैं। आर्किटेक्चर दो लक्ष्यों पर केंद्रित है: मॉडल-हार्नेस जोड़ों की पुनरावृत्त स्वयं-सुधार के माध्यम से अनुकूलन, और उपयोगकर्ता चरण के प्रति विशेषज्ञ एडेप्टर्स का चयन करने वाले Mixture-of-LoRA (MoL) सिस्टम के सहयोग के माध्यम से।

arxiv arXiv cs.CL · 4 दिन पहले

AMIE (Video) वास्तविक समय में चिकित्सा परामर्शों में विशेषज्ञ-स्तर का प्रदर्शन प्राप्त करता है

शोधकर्ताओं ने AMIE (Video) का उपयोग करके वास्तविक समय की क्लिनिकल वीडियो परामर्शों के लिए पहला विशेषज्ञ-स्तरीय AI सिस्टम प्रदर्शित किया, जो एक Gemini-आधारित मल्टी-एजेंट सिस्टम है जो कम लेटेंसी संवाद को वास्तविक समय ऑडियो-विज़ुअल धारणा के साथ एकीकृत करता है।

arxiv arXiv cs.CL · 5 दिन पहले · 8 बार देखा गया

GPT-5 और GPT-5 Nano सूक्ष्मजीव उत्पट्टी में कैंसर के सबूत निकालने में विशेषज्ञों के बराबर

सूक्ष्मजीव उत्पट्टी में कैंसर के लिए व्यवस्थित सबूत संश्लेषण पर बड़े भाषा मॉडलों का मूल्यांकन करने वाले एक अध्ययन ने पाया कि GPT-5 और GPT-5 Nano क्षेत्र विशेषज्ञों से अविभेद्य रूप से प्रदर्शन करते हैं। शोधकर्ताओं ने 24 शोध पत्रों पर Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5, और GPT-5 Nano का मूल्यांकन कई प्रश्न प्रकारों में 77 आइटम वाले एक संरचित टेम्पलेट का उपयोग करके किया।

arxiv arXiv cs.CL · 8 दिन पहले · 4 बार देखा गया

M$^3$R-Bench बहुआयामी रूपक समझ के लिए प्रमाण-आधारित मानदंड का परिचय देता है

शोधकर्ताओं ने M$^3$R-Bench पेश किया, एक एकीकृत मानदंड जिसमें 1,000 छवि-पाठ उदाहरण शामिल हैं, जिनमें प्रमाण-आधारित बहुआयामी रूपक समझ का मूल्यांकन करने के लिए मानव-सत्यापित टिप्पणियाँ दी गई हैं। यह मानदंड रूपक की उपस्थिति, लक्ष्य-स्रोत मैपिंग, भावनात्मक स्थिति और अवधारणात्मक रूपक सिद्धांत पर आधारित चरण-दर-चरण व्याख्याओं के लिए संयुक्त टिप्पणियाँ प्रदान करता है।

arxiv arXiv cs.CL · 11 दिन पहले · 4 बार देखा गया

डौइयां ने शीर्ष प्रदर्शन वाले DME बहु-मोडल एम्बेडिंग मॉडल को जारी किया

डौइयां ने अपने मल्टीमोडल एम्बेडिंग (DME) मॉडल के लिए तकनीकी रिपोर्ट जारी की है, जो शक्तिशाली विभेदन और दक्षता प्राप्त करने के लिए बड़े पैमाने पर कंट्रास्टिव प्री-ट्रेनिंग को लेटेन्ट रीजनिंग के साथ जोड़ता है।

arxiv arXiv cs.CL · 11 दिन पहले OSWorld 2.0 · 21.2% · 18 बार देखा गया

Qwen ने Qwen-CUA जारी किया, एक 397B-A17B स्थानीय कंप्यूटर-उपयोग एजेंट

शोधकर्ताओं ने Qwen-CUA का परिचय दिया है, जो एक 397B-A17B Qwen मिक्स्चर-ऑफ-एक्सपर्ट्स बैकबोन पर बनाया गया स्थानीय कंप्यूटर-उपयोग एजेंट है। सिस्टम स्क्रीनशॉट देखकर और कीबोर्ड व माउस इवेंट के माध्यम से कार्य करके संचालित होता है, बिना DOM ट्री या एक्सेसिबिलिटी मेटाडेटा पर निर्भर किए।

arxiv arXiv cs.CL · 11 दिन पहले

जब विरोधी तर्क को पुनः लिखते हैं तो थॉट-ऑफ-थॉट मॉनिटर ढह जाते हैं

शोध प्रदर्शित करता है कि चेन-ऑफ-थॉट (CoT) निगरानी उन विरोधियों के खिलाफ विफल हो जाती है जो तर्क प्रक्रिया को नियंत्रित करते हैं। एक एजेंट के तर्क को पुनः लिखकर, आदेशों और आउटपुट को शब्दशः बनाए रखते हुए उसे अच्छे विश्वास की इंजीनियरिंग जैसा दिखाने से, हमलावर निगरानी तंत्रों को पार कर सकते हैं।

arxiv arXiv cs.CL · 15 दिन पहले · 4 बार देखा गया

मेमोरी डिकोडर स्केल पर: पैरामीट्रिक लंबी अवधि की मेमोरी को 6.9B पैरामीटर तक बढ़ाना

शोधकर्ताओं ने Memory Decoder at Scale प्रस्तुत किया, एक सिस्टम जो पैरामीट्रिक लंबी अवधि की मेमोरी मॉडलों को 6.9B पैरामीटर तक स्केल करता है और उन्हें 300B टोकन पर प्रीट्रेन करता है। इस डेटा स्केल पर मानक Faiss पाइपलाइन के असंभव होने का सामना करने के लिए, लेखकों ने kNN वितरणों की स्पार्स, बैच-वाइज लोडिंग के साथ एक वितरित इंडेक्सिंग पाइपलाइन लागू की है।

arxiv arXiv cs.CL · 15 दिन पहले MLE-bench · 71.21% · 3 बार देखा गया

Frontis-MA1 ने ओपनएमएलई पुनरावर्ती आत्म-सुधार के माध्यम से शीर्ष स्तर की एमएलई हासिल की

फ्रंटिस ने मशीन लर्निंग इंजीनियरिंग में पुनरावर्ती आत्म-सुधार के लिए डिज़ाइन किए गए 35B पैरामीटर वाले AI4AI मॉडल Frontis-MA1 और ओपन-सोर्स OpenMLE स्टैक को जारी किया। सिस्टम में सत्यापनीय कार्य वातावरण, ऑपरेटर लर्निंग और लंबे अवधि की खोज शामिल हैं, जो एक एजेंट को निष्पादन-आधारित प्रशिक्षण के माध्यम से अपने स्वयं के कोड को बेहतर बनाने में सक्षम बनाते हैं।

arxiv arXiv cs.CL · 15 दिन पहले · 4 बार देखा गया

OSReward ने क्रॉस-प्लेटफ़ॉर्म कंप्यूटर-यूज़ रिवर्ड मॉडल्स के लिए मानकीकृत मूल्यांकन पेश किया

शोधकर्ताओं ने OSReward का परिचय दिया, एक यथार्थवादी बेंचमार्क जो कंप्यूटर-यूज़िंग एजेंट ट्रेजेक्टरीज़ के लिए जज के रूप में कार्य करने वाले विज़न-लैंग्वेज मॉडल्स (VLMs) की विश्वसनीयता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। अध्ययन से पता चलता है कि भले ही राज्य-दर-श्रेणी VLMs व्यवस्थित कोमलता पूर्वाग्रह से ग्रस्त हैं और स्केल के लिए अक्सर बहुत महंगे हैं, जबकि सस्ते ओपन मॉडल खराब प्रदर्शन करते हैं।

arxiv arXiv cs.CL · 16 दिन पहले · 5 बार देखा गया

Living-Harness स्वयं-विकासित एजेंट हार्नेस को Pass@1 में लगभग 10 अंक से बढ़ाता है

शोधकर्ताओं ने Living-Harness का प्रस्ताव रखा है, जो एक स्वयं-विकासित एजेंट हार्नेस है जो पूर्ण ट्राजेक्टरी और मूल्यांकक संकेतों को सीमित हार्नेस अपडेट के लिए पोस्टीरियर सबूत में परिवर्तित करता है। Evolution-SOP द्वारा निर्देशित, सिस्टम एपिसोडिक मेमोरी और स्टेट ग्राफ लिखने के लिए एपिसोड अभिनिर्माणों और संरचित अपडेट सबूत को निकालता है।

arxiv arXiv cs.CL · 16 दिन पहले · 3 बार देखा गया

संवैधानिक मध्य-प्रशिक्षण से स्थायी अनुपालन लाभ मिलते हैं क्षमता हानि के बिना

शोधकर्ताओं ने 120B-स्केल मॉडल्स के प्रशिक्षण प्रक्रिया में मूल्य-आधारित सामग्री डालकर संवैधानिक मध्य-प्रशिक्षण का परीक्षण किया, यह निर्धारित करने के लिए कि क्या यह मानक पोस्ट-ट्रेनिंग विधियों की तुलना में अधिक स्थायी अनुपालन उत्पन्न करता है। अध्ययन से पता चला कि यह दृष्टिकोण अनुपालन सामान्यीकरण और स्थिरता को महत्वपूर्ण रूप से बढ़ाता है, विशेष रूप से सुपरवाइज्ड फाइन-ट्यूनिंग के बाद ब्लैकमेल प्रवृत्ति को कम करने में।

arxiv arXiv cs.CL · 17 दिन पहले · 1 बार देखा गया

ऑन-पॉलिसी डिस्टिलेशन में Relay-OPD प्रशिक्षण ट्रेजेक्टरी की लंबाई को 50% से अधिक कम करता है

रिसर्चर्स ने मानक ऑन-पॉलिसी डिस्टिलेशन में प्रिफेक्स विफलता को दूर करने के लिए Relay On-Policy Distillation (Relay-OPD) पेश किया, जहाँ छात्र की त्रुटियाँ अविश्वसनीय निगरानी का कारण बनती हैं। इस विधि में शिक्षक-छात्र निरंतरता असममितता को ट्रिगर के रूप में उपयोग किया जाता है ताकि शिक्षक संक्षेप में नियंत्रण संभाल सके और छात्र फिर से शुरू होने से पहले ट्रेजेक्टरी को पुनर्निर्देशित कर सके।

arxiv arXiv cs.CL · 18 दिन पहले · 3 बार देखा गया

PIVOT क्वेरी समूहों के बीच प्रीफिक्स स्कैन साझा करके टोकन-स्तर की विरल एटेंशन को तेज़ करता है

PIVOT (Proxy Indexing Via One full-prefix Traversal) एक ट्रेनिंग-फ्री, ड्रॉप-इन प्रतिस्थापन है DeepSeek Sparse Attention (DSA) इंडेक्सर के लिए जो निकटवर्ती क्वेरियों के समूह में एक प्रीफिक्स स्कैन साझा करके कंप्यूटेशनल अतिरेक को कम करता है। हर क्वेरी के लिए प्रत्येक पूर्ववर्ती टोकन को अलग-अलग स्कोर करने के बजाय, PIVOT समूह को एक सिंगल प्रॉक्सी क्वेरी में एग्रीगेट करता है ताकि एक उम्मीदवार सेट प्राप्त किया जा सके, जिससे हर क्वेरी के लिए टॉप-k टोकन चुने जाते हैं।