स्रोत · arXiv cs.AI
arxiv arXiv cs.AI · 17 घंटे पहले · 1 बार देखा गया

Faraday 27B ने लेख प्रतिकृति कार्यों में Claude Opus 4.8 और GPT-5.5 को पार कर लिया

शोधकर्ताओं ने Replica विकसित किया है, जो लेख प्रतिकृति के लिए एक स्केलेबल कार्य स्थान है, और मानव मूल्यांकन के साथ संरेखित कम-शोर वाले पुरस्कार संकेत प्रदान करने के लिए स्वचालित रूप से उत्पन्न रूबरिक-आधारित जज का परिचय दिया है।

arxiv arXiv cs.AI · 17 घंटे पहले

AutoDesign लंबी अवधि के एजेंटिक डिज़ाइन को बेहतर बनाने के लिए मेटा-हार्नेस अनुकूलन का उपयोग करता है

पत्र में AutoDesign पेश किया गया है, एक फ्रेमवर्क जो रोलआउट फीडबैक के आधार पर अपने हार्नेस को पुनरावृत्त रूप से सुधारने के लिए कोड एजेंट को मार्गदर्शन करने के लिए मेटा-हार्नेस ऑप्टिमाइज़र का उपयोग करता है। यह दृष्टिकोण मानव डिज़ाइन प्रायर्स के साथ सामंजस्य और पुनरावृत्त आत्म-सुधार के लिए पुन: प्रयोग योग्य अनुभव को संचित करने का लक्ष्य रखता है।

arxiv arXiv cs.AI · 2 दिन पहले · 3 बार देखा गया

SCOUT संरचित CoT और प्रक्रिया-सुपरवाइज्ड RL के माध्यम से VLMs में स्थानिक तर्कशक्ति को बेहतर बनाता है

शोधकर्ताओं ने SCOUT का प्रस्ताव रखा है, एक फ्रेमवर्क जो संरचित चेन-ऑफ़-थॉट (Chain-of-Thought) को बहु-उद्देश्यीय प्रक्रिया-पुरस्कार पुनर्बल सीखने (multi-objective process-reward reinforcement learning) के साथ मिलाकर विज़न-लैंग्वेज मॉडल्स की स्थानिक तर्कशक्ति को बढ़ाता है। यह दृष्टिकोण मौजूदा RL तरीकों में क्रेडिट असाइनमेंट की समस्याओं को हल करता है और व्यापक 3D समझ के लिए गहराई का अनुभव (depth perception) एकीकृत करता है।

arxiv arXiv cs.AI · 2 दिन पहले HealthBench · 51.9% · 4 बार देखा गया

VITA क्लिनिकल RAG HealthBench पर फ्रंटियर LLMs के बराबर या बेहतर प्रदर्शन करता है

VITA नामक एक विशेष रूप से बनाया गया रीट्रीवल-अगमेंटेड जनरेशन सिस्टम, जो कम और मध्यम आय वाले क्षेत्रों के लिए डिज़ाइन किया गया था, का HealthBench बेंचमार्क पर सामान्य उद्देश्य वाले बड़े भाषा मॉडल्स के साथ मूल्यांकन किया गया। अध्ययन दिखाता है कि कॉर्पस-विशिष्ट डिज़ाइन नए फ्रंटियर मॉडल्स जारी होने के बावजूद प्रतिस्पर्धी प्रदर्शन बनाए रख सकता है।

arxiv arXiv cs.AI · 3 दिन पहले

संदर्भ-मुक्त पोस्ट-ट्रेनिंग के माध्यम से MiLMMT-46-v1.0 बहुभाषी अनुवाद में सुधार करता है

शोधकर्ताओं ने MiLMMT-46-v1.0 विकसित किया है, जो एक बहुभाषी मशीन अनुवाद मॉडल है जो खुले बड़े भाषा मॉडलों पर संदर्भ-मुक्त पोस्ट-ट्रेनिंग लागू करता है। टीम ने भाषा पहचान द्वारा गेट किए गए दो संदर्भ-मुक्त गुणाकार अनुमान मॉडलों पर आधारित पुरस्कार के साथ ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) का उपयोग किया है।

arxiv arXiv cs.AI · 4 दिन पहले

ओपन-एंडेड ऑप्टिमाइजेशन GPT-5.5 को अपनी सुधार प्रक्रिया स्वयं संयोजित करने देता है

लेख ओपन-एंडेड ऑप्टिमाइजेशन (OEO) का परिचय देता है, एक फ्रेमवर्क जो एक फ्रंटियर मॉडल ऑप्टिमाइजर को निर्धारित ऑप्टिमाइजेशन पाइपलाइन पर निर्भर रहने के बजाय अपनी सुधार प्रक्रिया को ऑनलाइन गतिशील रूप से संयोजित करने की अनुमति देता है। लेखकों ने आठ बेंचमार्क-टारगेट-मॉडल सेटिंग्स पर 14 हेड-टू-हेड तुलनाओं में OEO की तुलना दो चरणबद्ध दृष्टिकोणों, SkillOpt और GEPA से की है।

arxiv arXiv cs.AI · 4 दिन पहले

AMIE (Video) वास्तविक समय चिकित्सा परामर्शों में विशेषज्ञ-स्तर का प्रदर्शन प्राप्त करता है

शोधकर्ताओं ने AMIE (Video) का उपयोग करके वास्तविक समय की क्लिनिकल वीडियो परामर्शों के लिए पहला विशेषज्ञ-स्तरीय AI सिस्टम प्रदर्शित किया, जो एक Gemini-आधारित मल्टी-एजेंट सिस्टम है जो कम लेटेंसी संवाद को वास्तविक समय ऑडियो-विज़ुअल एड感知 के साथ एकीकृत करता है। 30 प्राथमिक देखभाल चिकित्सकों और 100 परिदृश्यों वाले एक यादृच्छिक उद्देश्य संरचित क्लिनिकल परीक्षण अध्ययन में, क्लिनिकल मूल्यांकनकर्ताओं ने सिस्टम का इतिहास लेने, निदान, प्रबंधन और शारीरिक अवलोकन में चिकित्सकों के बराबर या बेहतर रेटिंग दी।

arxiv arXiv cs.AI · 4 दिन पहले · 16 बार देखा गया

आक्रामक एन्क्रिप्टेड ब्लॉक कमजोरी के माध्यम से प्रोप्राइटरी LLM APIs से तर्क ट्रेस चुराते हैं

शोधकर्ताओं ने मुख्य बड़े भाषा मॉडल प्रदाताओं द्वारा चरण-दर-चरण तर्क ट्रेस को कैसे संभाला जाता है, उसमें एक वास्तुकला कमजोरी की पहचान की है। प्रदाता इन ट्रेस को ग्राहकों को एन्क्रिप्टेड ब्लॉक के रूप में लौटाते हैं, लेकिन अध्ययन पाता है कि ये ब्लॉक प्रदाता के पारिस्थितिकी तंत्र के भीतर विभिन्न सत्रों, उपयोगकर्ताओं और मॉडल के बीच पूरी तरह से संगत और अदला-बदली योग्य हैं।

arxiv arXiv cs.AI · 4 दिन पहले OSWorld · 90.69% · 6 बार देखा गया

ओरोबोरस स्व-विकासित एजेंट ने Opus 5 के साथ नए बेंचमार्क स्थापित किए

ओरोबोरस एक स्व-विकासित एजेंट फ्रेमवर्क है जहाँ टूल्स, प्रॉम्प्ट्स और कोर इम्प्लीमेंटेशन समीक्षित कमिट्स के माध्यम से सुधरते हैं जो बाद के काम के लिए रनटाइम बन जाते हैं। यह उपयोग के दौरान पाए गए बग और अक्षमताओं द्वारा ट्रिगर किए गए पुनरावर्ती मुक्त विकास या अनुभव-संचालित कोर विकास के माध्यम से संचालित होता है।

arxiv arXiv cs.AI · 4 दिन पहले

संगफोर् ने SESG तैनात किया, एक स्व-विकासशील सुरक्षा गार्डरेल प्रणाली

संगफोर् ने SESG (Self-Evolving Safety Guardrails) तैनात किया है, जो एक बहु-एजेंट सिस्टम है जो उत्पादन में नए खतरों के लिए LLM सुरक्षा रक्षाओं को निरंतर अनुकूलित करता है। सिस्टम नई जेलब्रेक्स और हानिकारक श्रेणियों के लिए लाइव ट्रैफिक की निगरानी करता है, फिर स्वचालित रूप से प्रशिक्षण डेटा का संश्लेषण करता है और मॉडल को अपडेट करता है, बिना किसी मानवीय हस्तक्षेप के।

arxiv arXiv cs.AI · 5 दिन पहले · 12 बार देखा गया

GPT-5 और GPT-5 Nano सूक्ष्मजीव ऑन्कोजेनेसिस शोध मूल्यांकन में विशेषज्ञों के बराबर

एक अध्ययन दिखाता है कि GPT-5 और GPT-5 Nano सूक्ष्मजीव ऑन्कोजेनेसिस पर शोध प्रकाशनों से सबूत निकालने और उनका आलोचनात्मक मूल्यांकन करने में विशेषज्ञ-स्तर की कार्यक्षमता हासिल करते हैं। शोधकर्ताओं ने MMTV-LV और स्तन कैंपर पर केंद्रित 24 प्रलेखनों के डेटासेट का उपयोग करके इन मॉडलों का मूल्यांकन डोमेन विशेषज्ञों के साथ Gemini 2.5 Pro और Gemini 2.5 Flash के साथ किया।

arxiv arXiv cs.AI · 9 दिन पहले SWE-bench Pro · 78.0% · 1 बार देखा गया

Argus: दीर्घकालिक तर्क के लिए एक सामान्य-उद्देश्य एजेंटिक रनटाइम

शोधकर्ताओं ने Argus प्रस्तुत किया, जो एक स्थिर, स्वयं-विकासशील एजेंटिक रनटाइम है जिसका डिज़ाइन दीर्घकालिक तर्क के लिए किया गया है और यह स्थिर उपयोगकर्ता इरादे को संचालनात्मक उद्देश्यों से अलग करता है। प्रणाली Manager, Planner, Engineer, और Reviewer भूमिकाओं का उपयोग करके टिकाऊ परियोजना अवस्था पर सीमित मिशन निष्पादित करती है, जिससे ऑपरेटर-स्वामित्व वाले एस्केलेशन बिंदुओं के बीच स्वतंत्र निष्पादन संभव होता है।

arxiv arXiv cs.AI · 9 दिन पहले

SciCode-Verified बेंचमार्क की त्रुटियों को ठीक करके मॉडलों की वास्तविक वैज्ञानिक-कोडिंग क्षमता को उजागर करता है

लेखकों ने पहचाना कि SciCode बेंचमार्क पर स्कोर में रुकावट का कारण मॉडल क्षमता की सीमाएं नहीं, बल्कि मूल्यांकन उपकरण में महत्वपूर्ण त्रुटियां हैं। 65 परीक्षण समस्याओं के एक क्षेत्र विशेषज्ञ द्वारा किए गए ऑडिट में 263 त्रुटियां पाई गईं, जिनमें से 192 ने गैर-पुनरुत्पादित स्वर्ग उत्तरों और अत्यधिक कठोर सहिष्णुता जैसे मुद्दों के कारण सही समाधानों को गलत तरीके से अस्वीकार कर दिया।

arxiv arXiv cs.AI · 10 दिन पहले

Video-DeepResearch ने निरंतर वीडियो स्ट्रीम के लिए बहुआयामी एजेंट पेश किया

शोधकर्ताओं ने Video-DeepResearch (Video-DR) पेश किया है, जो स्थिर छवियों से निरंतर वीडियो स्ट्रीम तक बहुआयामी एजेंटों को विस्तारित करने वाला एक ढांचा है, जो मोडालिटी पूर्वाग्रह और पैरामीट्रिक ज्ञान लीक होने की समस्याओं को दूर करता है। सिस्टम क्रॉस-फ्रेमल दृश्य आधार को वेब पुनर्प्राप्ति से पहले लागू करने के लिए चरण-दर-चरण टूल अनलॉकिंग के साथ एक अलग संवेदन-अन्वेषण पाइपलाइन का उपयोग करता है।

arxiv arXiv cs.AI · 15 दिन पहले WebArena · 73.6% · 4 बार देखा गया

Qwen-UI-Agent मोबाइल-यूज़ बेंचमार्क्स पर स्टेट ऑफ़ द आर्ट स्थापित करता है

Qwen टीम ने Qwen-UI-Agent के लिए एक तकनीकी रिपोर्ट जारी की है, जो एक वास्तविक-दुनिया केंद्रित फाउंडेशन GUI एजेंट है जिसे मोबाइल, कंप्यूटर-यूज़, वेब और DeepSearch पर्यावरणों में विश्वसनीय रूप से संचालित करने के लिए डिज़ाइन किया गया है। सिस्टम विविध सैंडबॉक्स पर्यावरणों को एक बड़े पैमाने के वास्तविक-डिवाइस मोबाइल रनटाइम के साथ जोड़ता है, GUI ऑपरेशन को CLI निष्पादन के साथ अंतर्भुजित करता है और लंबे-अवधि कार्यों का समर्थन करता है।

arxiv arXiv cs.AI · 18 दिन पहले · 1 बार देखा गया

ClinFusion ने समग्र चिकित्सा समझ के लिए दृष्टि-केंद्रित MLLM का परिचय दिया

शोधकर्ताओं ने ClinFusion का परिचय दिया है, जो एक दृष्टि-केंद्रित बहुआयामी बड़े भाषा मॉडल है जिसे क्लिनिकल प्रैक्टिस में AI को तैनात करने की चुनौतियों को 2D और 3D चिकित्सा छवि समझ को एकीकृत करके संबोधित करने के लिए डिज़ाइन किया गया है। इस सिस्टम में एक संयोजक कैस्केडेड वीजन एन्कोडर Cascade Spatial-Aware Locality Fusion ऑपरेटर के साथ शामिल है और इसमें MedIF-Bench और क्षेत्र-की-दृष्टि-ग्राउंडेड मेट्रिक्स से मिलकर बना एक नया मूल्यांकन फ्रेमवर्क शामिल है।

arxiv arXiv cs.AI · 18 दिन पहले

एथिस एलिजिबिलिटी मॉड्यूल LLM नियम मूल्यांकन त्रुटियों को ठीक करने के लिए न्यूरो-सिंबोलिक आर्किटेक्चर का उपयोग करता है

लेख में फ्रंटियर बड़े भाषा मॉडलों में एक विफलता श्रेणी का दस्तावेजीकरण किया गया है जिसे अपवाद चेन कोलाप्स कहा जाता है, जहाँ मॉडल नेस्टेड कंडीशनल नियमों का गलत मूल्यांकन करते हैं। इसे संबोधित करने के लिए, लेखक एथिस एलिजिबिलिटी मॉड्यूल प्रस्तुत करते हैं, जो एक न्यूरो-सिंबोलिक आर्किटेक्चर है जो LLM द्वारा लिखित नियमों को SMT-आधारित परत के साथ जोड़ता है ताकि निर्धारणात्मक निष्पादन हो सके।

arxiv arXiv cs.AI · 22 दिन पहले OSWorld · 37.7% · 5 बार देखा गया

OpenForgeRL किसी भी वातावरण में हैरनेस-आधारित एजेंट्स के अंत-से-अंत प्रशिक्षण को सक्षम बनाता है

OpenForgeRL एक ओपन-सोर्स फ्रेमवर्क है जो शोधकर्ताओं को मानक रीइन्फोर्समेंट लर्निंग स्टैक्स का उपयोग करके हैरनेस-आधारित AI एजेंट्स के अंत-से-अंत प्रशिक्षण की अनुमति देता है। यह एक हल्के प्रॉक्सी के माध्यम से प्रशिक्षण को इनफरेंस से अलग करके इसे प्राप्त करता है जो मॉडल कॉल्स को डेटा के रूप में रिकॉर्ड करता है और एक Kubernetes ऑर्केस्ट्रेटर जो रिमोट कंटेनर रोलआउट का प्रबंधन करता है।

arxiv arXiv cs.AI · 22 दिन पहले · 4 बार देखा गया

AREX ने पुनरावर्ती रूप से स्वयं को सुधारने वाले गहन शोध एजेंट्स का परिचय दिया

शोधकर्ताओं ने AREX का परिचय दिया, जो एक परिवार है पुनरावर्ती रूप से स्वयं को सुधारने वाले (RSI) गहन शोध एजेंट्स का, जो जटिल क्वेरीज़ में खोज और सत्यापन के बीच असममितता को संबोधित करने के लिए डिज़ाइन किए गए हैं। AREX एक आंतरिक लूप के बीच बारी-बारी से काम करता है जो सबूत इकट्ठा करता है और अस्थायी उत्तर बनाता है, और एक बाहरी लूप जो निर्देशित सुधार को मार्गदर्शन करने के लिए बाधाओं का ऑडिट करता है।

arxiv arXiv cs.AI · 23 दिन पहले · 4 बार देखा गया

SLAI T-Rex, Ascend SuperPOD पर DeepSeek-V4 के पूर्ण-पैरामीटर पोस्ट-ट्रेनिंग को सक्षम बनाता है

SLAI ने T-Rex पेश किया, जो Ascend NPU SuperPOD पर ट्रिलियन-पैरामीटर-स्केल MoE मॉडल्स के पूर्ण-पैरामीटर पोस्ट-ट्रेनिंग के लिए एक एंड-टू-एंड ऑप्टिमाइजेशन फ्रेमवर्क है। लक्ष्य वर्कलोड के रूप में DeepSeek-V4 मॉडल फैमिली का उपयोग करते हुए, सिस्टम हियरार्किकल पैरेलेलिज्म और कर्नेल एक्जीक्यूशन ऑप्टिमाइजेशन के माध्यम से मेमोरी प्रेशर और कम्युनिकेशन ओवरहेड को संबोधित करता है।