Research paper
arxiv arXiv cs.AI · 2 घंटे पहले · 9 बार देखा गया

AIDE^2 एआई शोध एजेंट्स के पुनरावर्ती स्वयं-सुधार को सक्षम बनाता है

शोधकर्ताओं ने AIDE^2 प्रस्तुत किया, एक सिस्टम जो अपने स्वयं के कोड को अनुकूलित करके एआई शोध एजेंट के लिए पुनरावर्ती स्वयं-सुधार की लूप लागू करता है। सिस्टम अपनी आंतरिक तर्क में परिवर्तन सुझाता है, AI R&D कार्यों पर संशोधित संस्करणों का मूल्यांकन करता है, और केवल उन सुधारों को बनाए रखता है जो छिपे हुए मूल्यांकनों पर सबसे अच्छा प्रदर्शन करते हैं।

arxiv arXiv cs.AI · 3 घंटे पहले WebArena · 45.3% · 13 बार देखा गया

Growing Harness दोहराए जाने वाले एजेंट नियंत्रण को विफलता-मार्गदर्शित प्रशिक्षण के माध्यम से पुनः उपयोग योग्य कोड में बदलता है

लेखकों ने Growing Harness पेश किया, जो एक प्रशिक्षण पैराडाइम है जो कार्य फीडबैक से एजेंट के नियंत्रण संरचना को सीखता है, न कि भारी संदर्भ वाले हार्नेस पर निर्भर रहकर। दोहराए जाने वाले नियंत्रण निर्णयों को निष्पादन योग्य कोड में बदलकर और अर्थपूर्ण तर्क के लिए LLM कॉल को सुरक्षित रखकर, इस विधि का उद्देश्य पुनः उपयोग योग्य विशेषज्ञ एजेंट बनाना है।

arxiv arXiv cs.LG · 4 घंटे पहले · 11 बार देखा गया

AIDE^2 एआई शोध एजेंट्स के पुनरावर्ती स्वयं-सुधार को सक्षम बनाता है

शोधकर्ताओं ने AIDE^2 प्रस्तुत किया, एक सिस्टम जो अपने स्वयं के कोड को अनुकूलित करके एक फ्रंटियर एआई शोध एजेंट के लिए पुनरावर्ती स्वयं-सुधार की लूप लागू करता है। सिस्टम अपने आंतरिक तर्क में परिवर्तन सुझाता है, एआई R&D कार्यों पर संशोधित संस्करणों का बेंचमार्किंग करता है, और केवल उन अपडेट्स को ही बनाए रखता है जो छिपे हुए मूल्यांकनों पर सबसे अच्छा प्रदर्शन करते हैं।

arxiv arXiv cs.CL · 7 घंटे पहले · 12 बार देखा गया

Agensh संगठनात्मक बुद्धिमत्ता को 1,024 एजेंट्स तक स्केल करता है

शोधकर्ताओं ने Agensh का परिचय दिया, एक स्केलेबल स्व-संगठित मल्टी-एजेंट हार्नेस जो समवर्ती कार्यकर्ताओं को उप-कार्यों को असिंक्रोनस रूप से दावा करने और प्रगति को विलय करने की अनुमति देकर केंद्रीय ऑर्केस्ट्रेटर बॉटलनेक को समाप्त करता है।

arxiv arXiv cs.CL · 7 घंटे पहले · 11 बार देखा गया

TelecomGPT-R1: विविध टेलीकॉम कार्यों में तर्क के लिए एकीकृत पोस्ट-ट्रेनिंग

शोधकर्ताओं ने TelecomGPT-R1 का परिचय दिया है, जो एक खुला-स्रोत एकीकृत टेलीकॉम तर्क मॉडल परिवार है, जो मानकों, कॉन्फ़िगरेशन और लॉग पर तर्क करके इंजीनियरिंग कार्यों को स्वचालित करने के लिए डिज़ाइन किया गया है। यह मॉडल प्रोटोकॉल, ज्ञान, मॉडलिंग और दोष अक्षों को कवर करने वाले एक संरचित दृष्टिकोण के माध्यम से मौजूदा सामान्य-उद्देश्य और विशेष LLMs की सीमाओं को दूर करता है।

arxiv arXiv cs.LG · 1 दिन पहले HealthBench · 50.1% · 10 बार देखा गया

Fathom-Vaidya रूब्रिक-आधारित पुरस्कारों के साथ चिकित्सा तर्क को बेहतर बनाता है

लेखकों ने Fathom-Vaidya का परिचय दिया, जो 30B पैरामीटर वाला एक मॉडल है जो संज्ञानात्मक और क्लिनिकल हेल्थकेयर तर्क को बढ़ाने के लिए सिंथेटिक डेटा और रूब्रिक-आधारित पुनर्बल सीखने का उपयोग करता है। प्रशिक्षण ढांचा पहले निदान के लिए MedBullets से प्राप्त प्रश्नों पर नियम-निर्देशित RL लागू करता है, फिर इंटरैक्टिव क्लिनिकल कार्यों के लिए बहु-आयामी रूब्रिक्स के साथ 5.3k सिंथेटिक मल्टी-टर्न परिदृश्यों का उपयोग करता है।

arxiv arXiv cs.AI · 1 दिन पहले HealthBench · 50.1% · 12 बार देखा गया

Fathom-Vaidya रूबरिक-आधारित पुरस्कारों के साथ चिकित्सा तर्क को बेहतर बनाता है

लेखकों ने Fathom-Vaidya का परिचय दिया, जो 30B पैरामीटर वाला एक मॉडल है जो संश्लेषित डेटा और रूबरिक-आधारित पुनर्बल सीखने (reinforcement learning) का उपयोग करके नैदानिक और चिकित्सा स्वास्थ्य तर्क को बढ़ाने के लिए। प्रशिक्षण ढांचा पहले MedBullets से व्युत्पन्न प्रश्नों का उपयोग करके नैदानिक सटीकता पर केंद्रित होता है और फिर बहु-आयामी रूबरिक के साथ 5.3k उत्पन्न परिदृश्यों के माध्यम से बहु-चरण चिकित्सा बातचीत को संबोधित करता है।

arxiv arXiv cs.CL · 1 दिन पहले HealthBench · 50.1% · 12 बार देखा गया

Fathom-Vaidya रूब्रिक-आधारित पुरस्कारों के साथ चिकित्सा तर्क को बेहतर बनाता है

लेखकों ने Fathom-Vaidya का परिचय दिया, जो 30B पैरामीटर वाला एक मॉडल है जो सिंथेटिक डेटा और रूब्रिक-आधारित रीइन्फोर्समेंट लर्निंग का उपयोग करके नैदानिक और क्लिनिकल हेल्थकेयर तर्क को बढ़ावा देता है।

lab Microsoft Research Blog · 2 दिन पहले · 29 बार देखा गया

माइक्रोसॉफ्ट ने रेट्रोसाइमेरा को रेट्रोसिंथेसिस भविष्यवाणी के लिए जारी किया

माइक्रोसॉफ्ट रिसर्च ने रेट्रोसिंथेसिस भविष्यवाणी के लिए एक नया फ्रेमवर्क, RetroChimera को प्रकाशित और ओपन-सोर्स किया है, जो उच्च गुणवत्ता वाले संश्लेषण मार्गों का सुझाव देने के लिए दो पूरक मॉडलों को जोड़ता है। सिस्टम एक सीखी हुई एन्सेंबलिंग रणनीति का उपयोग करके R-SMILES 2, एक Transformer-आधारित de-novo मॉडल, और NeuralLoc, एक ग्राफ न्यूरल नेटवर्क (GNN) आधारित मॉडल को एकीकृत करता है।

media Hugging Face Forums · 2 दिन पहले · 15 बार देखा गया

प्रपोजिशन विघटन और विरोधाभास-चालित तर्क प्रणाली के लिए प्रस्ताव

एक लेखक ने एक ऐसे तर्क प्रणाली के शोध डिज़ाइन का प्रस्ताव दिया है जो दो प्रपोजिशन के बीच विरोधाभासों का पता लगाती है, उन्हें छोटे घटकों में विघटित करके और तार्किक टकराव की खोज करके, सीधे LLM निर्णय पर निर्भर करने के बजाय।

arxiv arXiv cs.AI · 2 दिन पहले · 18 बार देखा गया

CodeMidas स्रोत कोड का उपयोग करके एजेंटिक कोडिंग RL पर्यावरणों को स्केल करता है

शोधकर्ताओं ने CodeMidas पेश किया, जो एक एजेंटिक पाइपलाइन है जो ओपन-सोर्स कोडबेसेस में कार्यान्वित फ़ंक्शनलिटी से पुनर्बल सीखने (reinforcement learning) पर्यावरण बनाती है, स्रोत कोड को एकमात्र इनपुट के रूप में उपयोग करके। विधि एजेंटिक कंप्यूट को फ़ंक्शनलिटी का अन्वेषण करने, निष्पादन-आधारित परीक्षण बनाने और बार-बार रोलआउट के माध्यम से कार्यों की सत्यापन करने के लिए आवंटित करती है, जिसके परिणामस्वरूप 23 प्रोग्रामिंग भाषाओं में 5,545 प्रशिक्षण कार्यों का एक डेटासेट बनता है। इन कार्यों पर GRPO के साथ MiMo-V2.5 को प्रशिक्षित करने से DeepSWE (+11.7%), ProgramBench (+17%) और Terminal-Bench v2.1 (+8.5%) सहित पांच विविध बेनचमार्क्स पर प्रदर्शन में सुधार होता है। ट्रैजेक्टरी विश्लेषण संकेत देता है कि RL-प्रशिक्षित एजेंट ने बेहतर व्यवहार प्रदर्शित किए, जैसे कोडबेस का अधिक अन्वेषण और अधिक विविध स्वयं सत्यापन। ये परिणाम स्रोत कोड को स्केलेबल आधार के रूप में स्थापित करते हैं जो विविध सॉफ्टवेयर कार्यों में कोडिंग एजेंट्स को बेहतर बनाने वाले RL पर्यावरण बनाने के लिए उपयोगी है।

arxiv arXiv cs.CL · 2 दिन पहले · 10 बार देखा गया

TrialAtlas: बहु-एजेंट प्रणाली नैदानिक परीक्षण डिज़ाइन जोखिम मूल्यांकन में सुधार करती है

शोधकर्ताओं ने TrialAtlas पेश किया है, एक मेमोरी-संवर्धित बहु-एजेंट शोध संगठन जिसे नैदानिक विकास योजना (CDP) में सहायता के लिए डिज़ाइन किया गया है। यह प्रणाली साहित्य संश्लेषण, प्रतिस्पर्धी बुद्धिमत्ता और विनियोग विश्लेषण के लिए विशेषज्ञ एजेंटों का समन्वय करती है ताकि विकास जोखिमों की पूर्वानुमान लगाई जा सके।

media Hugging Face Forums · 2 दिन पहले · 18 बार देखा गया

MB-Bidram ने तर्क और ज्ञान को अलग करने वाली प्रयोगात्मक WideNDepth आर्किटेक्चर साझा की

MB-Bidram ने एक प्रयोगात्मक न्यूरल आर्किटेक्चर जारी किया है जिसे WideNDepth (WND) कहा जाता है, जो तर्क करने की क्षमताओं को ज्ञान भंडारण से अलग करने के लिए डिज़ाइन किया गया है। मॉडल में एक "Wide भाग" होता है जो मेमोरी के रूप में काम करता है और एक "Depth भाग" होता है जो तर्ककर्ता के रूप में कार्य करता है।

media Hugging Face Forums · 3 दिन पहले · 16 बार देखा गया

शोधकर्ता LLM सहमति अस्पष्टता को हल करने के लिए एक स्वतंत्र टिप्पणीकार की तलाश में है

एक शोधकर्ता 100 तुर्की कथात्मक दृश्यों को लेबल करने के लिए एक एकल स्वतंत्र मानव टिप्पणीकार का अनुरोध कर रहे हैं ताकि यह निर्धारित किया जा सके कि कम इंटर-रेटर सहमति कार्य की व्याख्यात्मक प्रकृति से उत्पन्न होती है या अधूरी टिप्पणी परिभाषाओं से। अध्ययन में पाया गया कि चार LLMs और एक नियम-आधारित डिटेक्टर एक-दूसरे और मानव संदर्भ के साथ लगभग संयोग स्तर पर सहमत थे, जिसमें Cohen’s κ स्कोर 0.000 से 0.185 तक थे।

media Hugging Face Forums · 3 दिन पहले · 17 बार देखा गया

GlucoEdge: INT8 क्वांटिज़ेशन के साथ ऑन-डिवाइस ग्लूकोज ट्रेंड फोरकास्टिंग

स्वतंत्र शोधकर्ता मोहमद मेनासी ने GlucoEdge प्रकाशित किया है, जो निरंतर ग्लूकोज मॉनिटर डेटा से पांच-श्रेणी, 15-मिनट के ग्लूकोज ट्रेंड फोरकास्टिंग के लिए एक एंड-टू-एंड ऑन-डिवाइस मशीन लर्निंग पाइपलाइन का विवरण देने वाला इंजीनियरिंग अध्ययन है। इस कार्य में केवल 2,909 पैरामीटर वाले एक कॉम्पैक्ट 1D CNN को पेश किया गया है और PyTorch से LiteRT रूपांतरण तक की पूरी वर्कफ़्लो को कवर किया गया है।

media Hugging Face Forums · 3 दिन पहले · 18 बार देखा गया

प्रस्ताव: एक स्थिर 4B मॉडल के लिए Qwen 9B से 27B तक क्रमिक ज्ञान स्थानांतरण

Hugging Face फोरम पर एक उपयोगकर्ता ने क्रमिक ज्ञान स्थानांतरण में एक प्रयोग का प्रस्ताव रखा है, जहां एक स्थिर-आकार का छात्र मॉडल (Qwen 4B) सबसे बड़े उपलब्ध स्रोत से सीधे सीखने के बजाय बढ़ते आकार के शिक्षक मॉडलों से क्रमिक रूप से सीखता है।

media Hugging Face Forums · 4 दिन पहले · 32 बार देखा गया

साहित्य समीक्षा पाती है कि संपीड़न बचत मापी गई ऊर्जा के साथ कमजोर रूप से सहसंबंधित है

एक स्वतंत्र शोधकर्ता ने एक साहित्य समीक्षा प्रकाशित की है जिसमें यह विश्लेषण किया गया है कि क्वांटीकरण, प्रूनिंग और डिस्टिलेशन जैसे मॉडल संपीड़न तकनीकें वास्तव में मापी गई ऊर्जा खपत को कम करती हैं या केवल FLOPs को कम करती हैं।

lab NVIDIA Research · 7 दिन पहले · 19 बार देखा गया

Human2Any: प्रतिबंध-जागरूक संयोजी योजना के माध्यम से मानव से रोबोट स्थानांतरण

लेख में Human2Any का परिचय दिया गया है, जो प्रतिबंध-जागरूक संयोजी योजना का उपयोग करने वाला एक मानव से रोबोट स्थानांतरण विधि है। स्रोत में कोई अन्य विवरण या मुख्य पाठ प्रदान नहीं किया गया है।

arxiv arXiv cs.LG · 7 दिन पहले · 20 बार देखा गया

OpenAI ने पूरी तरह से ऑडिट करने योग्य ट्रेनिंग रन के साथ Open-1B जारी किया

OpenAI ने Open-1B जारी किया है, एक भाषा मॉडल जिसे ऐसे नियम में प्रशिक्षित किया गया है जहाँ प्रशिक्षण के दौरान हर ऑपरेशन विषम कम्प्यूटिंग हार्डवेयर पर बिट-स्तर की सटीकता के साथ स्वतंत्र रूप से पुनरुत्पादित हो सकता है। यह दृष्टिकोण ओपन-सोर्स मॉडलों में निहित पुनरुत्पादन की समस्याओं को GPU kernel reductions और डेटा बैच ऑर्डरिंग जैसे नॉन-डिटरमिनिज्म स्रोतों पर एक निश्चित क्रम लागू करके हल करता है।

arxiv arXiv cs.AI · 8 दिन पहले · 24 बार देखा गया

एट्रिया डॉन प्रीव्यू: वैज्ञानिक शोध के लिए फाउंडेशन एजेंटिक लैंग्वेज मॉडल

एट्रिया डॉन प्रीव्यू एक फाउंडेशन एजेंटिक लैंग्वेज मॉडल है जो वैज्ञानिक शोध और इंजीनियरिंग वर्कफ़्लो के लिए डिज़ाइन किया गया है, जिसका प्रशिक्षण टूल-मध्यस्थता वाले इंटरैक्शन को एक्सेकुटेबल एन्वायरनमेंट से जोड़ने वाली एक वेरिफिएबल एक्सपीरियंस पाइपलाइन के माध्यम से किया गया है। वास्तविक शोध, इंजीनियरिंग और डिजिटल कार्य को कवर करने वाले 16 बेंचमार्क में, यह मॉडल फ्रंटियर एजेंट्स के साथ प्रतिस्पर्धी है और उनमें से पांच पर उच्चतम रिपोर्ट किए गए स्कोर प्राप्त करता है।