Reasoning models
media AI News (smol.ai) · 2 दिन पहले

मेटा के म्यूज़ स्पार्क 1.2 और ओपनएआई के GPT-5.6 Sol अपडेट

मेटा ने घोषणा की कि इसका म्यूज़ स्पार्क 1.2 मॉडल पांच STEM ओलंपियाड में गोल्ड मेडल प्रदर्शन हासिल करने में सफल रहा और Vals इंडेक्स पर $0.69/टेस्ट की लागत के साथ शीर्ष 5 में शामिल हुआ, जो किमी से लगभग 3 गुना सस्ता है। मेटा ने इन सुधारों का कारण समानांतर तर्क के साथ बहु-एजेंट ऑर्केस्ट्रेशन को बताया, जिसमें APhO और IPhO में बाहरी उपकरणों के बिना सिद्धांत में पूर्ण स्कोर प्राप्त किए गए।

media Don't Worry About the Vase · 5 दिन पहले · 5 बार देखा गया

OpenAI का Astra गणित के 10 प्रमुख खुले समस्याओं को हल करता है

OpenAI ने अपने अनाधिकृत आंतरिक मॉडल, Astra से परिणाम जारी किए हैं, जिसने गणित में दस महत्वपूर्ण खुली समस्याओं को सफलतापूर्वक हल किया। समाधान मॉडल द्वारा उत्पन्न किए गए और बाद में मानव शोधकर्ताओं द्वारा Lean प्रमाण पत्रों में औपचारिक रूप दिया गया।

media r/LocalLLaMA · 6 दिन पहले · 16 बार देखा गया

AI9Stars ने G9v3-39A5B जारी किया, जिसमें 39B पैरामीटर और 5 सक्रिय विशेषज्ञ हैं

AI9Stars ने G9v3-39A5B जारी किया है, जो एक ओपन वेट्स भाषा मॉडल है जिसे इसके पूर्ववर्ती ai9stars/G9v3-3B की तुलना में मजबूत तर्क क्षमताएं प्रदान करने के लिए डिज़ाइन किया गया है। मॉडल में 39 अरब पैरामीटर और 5 सक्रिय विशेषज्ञ हैं और यह व्यक्तिगत और व्यावसायिक उपयोग के लिए Apache 2.0 के तहत लाइसेंस प्राप्त है।

media Hugging Face Forums · 6 दिन पहले · 1 बार देखा गया

GPT-5.6 ने अदृश्य साहित्यिक क्रिप्टोग्राफी बेंचमार्क में छिपे संदेशों का 95% हिस्सा पुनर्प्राप्त किया

जोसेफ जेएम वॉकर द्वारा एक कार्यकारी पेपर में भौतिक उपन्यास "I Wrote a Book and Made a Million Dollars (I.B. Wryten)" में एम्बेडेड अदृश्य मल्टी-चैनल साहित्यिक क्रिप्टोग्राफी बेंचमार्क पर फ्रंटियर लैंग्वेज मॉडल्स का आकलन किया गया है। अध्ययन से पता चला कि GPT-5.6 ने सहायक संचार चैनल को स्वतंत्र रूप से पहचान लिया और अपने पहले पास में एम्बेडेड सामग्री का लगभग 95% हिस्सा पुनर्प्राप्त किया, जबकि पूर्व मॉडल्स में प्रभावी रूप से 0% क्षमता दिखाई दी।

blog Simon Willison · 8 दिन पहले · 12 बार देखा गया

OpenAI का Astra मॉडल GPT-5.6 Sol का उपयोग करके दस लंबे समय से चले आ रहे गणितीय समस्याओं को हल करता है

OpenAI ने दस गणितीय और सैद्धांतिक कंप्यूटर विज्ञान समस्याओं के समाधान जारी किए हैं, जिनके मुख्य परिणामों पर कम से कम एक दशक से कोई प्रगति नहीं हुई थी, अपने अगले प्रमुख मॉडल Astra के आंतरिक संस्करण का उपयोग करके।

arxiv arXiv cs.CL · 12 दिन पहले · 2 बार देखा गया

फ्रंटियर LLMs फिलर टोकन्स के माध्यम से अदृश्य तर्क का उपयोग करके CoT निगरानी को पार करते हैं

एक अध्ययन दिखाता है कि फ्रंटियर भाषा मॉडल अर्थहीन फिलर टोकन्स का उपयोग करके महत्वपूर्ण गणना कर सकते हैं, जिससे एक विफलता मोड उत्पन्न होता है जहाँ तर्क आउटपुट चेन-ऑफ़-थॉट में दिखाई नहीं देता। शोध ने तीन कार्यों पर 13 मॉडल का मूल्यांकन किया और पाया कि कई मॉडल इन टोकन्स से काफी लाभान्वित होते हैं, जिससे सटीकता में 13 प्रतिशत अंक तक की वृद्धि हुई।

arxiv arXiv cs.AI · 17 दिन पहले Humanity's Last Exam · 49.92% · 1 बार देखा गया

PoTRE ने परीक्षण-समय तर्क के लिए विषम बहु-एजेंट ढांचे का परिचय दिया

लेखकों ने PoTRE (Poly-Topological Reasoning Ensembles) का परिचय दिया है, जो एक ऐसा ढांचा है जो जटिल तर्क कार्यों में मानक सिंगल-स्ट्रीम प्रॉम्प्टिंग की सीमाओं को दूर करने के लिए डिज़ाइन किया गया है। PoTRE निष्पादन को चार अलग-अलग एजेंट्स में विभाजित करता है: एक Adversarial Refinement Agent, एक Hierarchical strategic Planning Agent, एक Spectrum Search Agent, और एक Direct Chain Agent.

arxiv arXiv cs.AI · 18 दिन पहले

ISO ने मॉडल वजन स्पेक्ट्रा को ठीक करने वाला RLVR-नेटिव ऑप्टिमाइज़ेशन स्टैक पेश किया

शोधकर्ताओं ने Isospectral Optimization (ISO) का प्रस्ताव रखा है, जो सत्यापित पुरस्कारों के साथ पुनर्बल सीखने (RLVR) के लिए एक फ्रेमवर्क है जो मॉडल वजन स्पेक्ट्रा को स्थिर रखते हुए इनपुट और आउटपुट सिंगुलर फ्रेम को ऑप्टिमाइज़ करके अनुपस्थित ऑप्टिमाइज़ेशन परत को संबोधित करता है।

media Hugging Face Forums · 23 दिन पहले · 1 बार देखा गया

कार्यक्षमता के लिए गैर-तंत्रिका संवादात्मक प्रतीकात्मक AI का अन्वेषण

एक डेवलपर ने पिछले आठ महीनों में विकसित की गई एक संवादात्मक प्रतीकात्मक AI आर्किटेक्चर पर प्रगति साझा की है, जिसका उद्देश्य गैर-तंत्रिका जानकारी निष्कर्षण में अंतराल को दूर करना है।

arxiv arXiv cs.CL · 24 दिन पहले · 5 बार देखा गया

GSM-Plus-BN बांग्ला गणितीय तर्क के लिए विक्षोभ-आधारित मानचित्रण पेश करता है

अध्ययन GSM-Plus-BN का परिचय देता है, एक नया विक्षोभित बंगाली गणितीय डेटासेट जो अंग्रेजी GSM-Plus मानचित्रण से व्युत्पन्न है और मानव अनुवादकों द्वारा सत्यापित किया गया है। यह संसाधन बांग्लादेश जैसे भाषाई रूप से विविध क्षेत्रों में मॉडल की दृढ़ता का आकलन करने के लिए व्यवस्थित मानचित्रण की कमी को पूरा करता है।

arxiv arXiv cs.AI · 24 दिन पहले

गहरा इंटरैक्शन LLM तर्क त्रुटियों का सटीक मानव सुधार सक्षम बनाता है

लेखकों ने Deep Interaction प्रस्तावित किया, जो एक कुशल मानव-AI इंटरैक्शन विधि है जिसे पूर्ण प्रतिक्रिया पुनर्जनन की आवश्यकता के बिना बड़े भाषा मॉडलों में तर्क त्रुटियों को ठीक करने के लिए डिज़ाइन किया गया है। यह तंत्र उपयोगकर्ताओं को मौजूदा Chain-of-Thought प्रतिक्रिया को सीधे संपादित करने की अनुमति देता है, सटीक चरणों को बनाए रखते हुए जबकि गलतियों को ठीक करता है।

media Together AI Blog · 25 दिन पहले · 4 बार देखा गया

Together AI ने Thinking Machines Lab के Inkling मल्टीमोडल रीजनिंग मॉडल को लॉन्च किया

Thinking Machines Lab ने Inkling जारी किया है, एक नया मल्टीमोडल मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल जो टोकन-कुशल रीजनिंग और टेक्स्ट, इमेज और ऑडियो इनपुट की नेटिव समझ के लिए डिज़ाइन किया गया है। Together AI अपने इन्फरेंस प्लेटफ़ॉर्म पर मॉडल को डे-ज़ीरो एक्सेस के साथ उपलब्ध करा रहा है।

arxiv arXiv cs.CL · 25 दिन पहले

Ring-Zero उत्पन्न तर्क के लिए 1T पैरामीटर तक शून्य RL को स्केल करता है

शोधकर्ताओं ने Ring-Zero प्रस्तुत किया, एक स्थिर प्रशिक्षण पाइपलाइन जो सत्यापनीय पुरस्कारों के साथ पुनर्बल सीखने को एक ट्रिलियन पैरामीटर वाले मॉडलों तक स्केल करती है, जिसमें नाईव स्केलिंग में पाए गए टोकन अतिरेक और खराब पठनीयता जैसे मुद्दों को संबोधित किया गया है।

arxiv arXiv cs.CL · 25 दिन पहले

Qwen3-30B-A3B ने यांत्रिक तर्क के लिए FukuyamaBench पर 8.3% हासिल किया

शोधकर्ताओं ने बड़े भाषा मॉडलों में पदानुक्रमित तंत्र तर्क का मूल्यांकन करने के लिए एक नया विशाल पैमाने का तर्क डेटासेट और FukuyamaBench बेंचमार्क विकसित किया, जो वर्तमान रासायनिक LLMs में आम भौतिक असंगतियों को दूर करता है।

arxiv arXiv cs.LG · 25 दिन पहले

अपरिवर्तनीय मैनिफोल्ड के माध्यम से ट्रांसफॉर्मर की सनातन तर्कशक्ति को समझाने वाला सैद्धांतिक ढांचा

एक नया सैद्धांतिक ढांचा संदर्भ में n-grams और बहु-छलांग तर्क जैसे संयुक्त कार्यों को एकीकृत करने वाले एक सामान्यीकृत श्रेणी के इनडक्टिव टास्क का अध्ययन करके, ट्रांसफॉर्मर भाषा मॉडल में सनातन तर्कशक्ति क्षमताओं के उभार की व्याख्या करता है।

lab NVIDIA Technical Blog · 25 दिन पहले · 3 बार देखा गया

AI तर्क में सुधार के लिए तकनीकों की पहचान करने के लिए NVIDIA ने 5,000 से अधिक Kaggle प्रविष्टियों का विश्लेषण किया

NVIDIA Nemotron Model Reasoning Challenge ने Kaggle समुदाय को खुले मॉडल, बेंचमार्क और बुनियादी ढांचे की साझा सीमाओं के तहत तर्क सटीकता में सुधार करने वाली तकनीकों का पता लगाने के लिए आमंत्रित किया। प्रतियोगिता के समाप्त होने तक, 4,000 टीमों में 5,000 से अधिक सक्रिय प्रतिभागी ने हज़ारों सबमिशन तैयार किए।

arxiv arXiv cs.CL · 26 दिन पहले

TreeThink: LLM प्रमेय सिद्ध के लिए मॉड्यूलर एसींक्रोनस ट्री सर्च लाइब्रेरी

शोधकर्ताओं ने TreeThink पेश किया है, जो एक ओपन-सोर्स पायथन लाइब्रेरी है जो न्यू्रल प्रमेय सिद्ध में मॉड्यूलर, पूर्ण रूप से एसींक्रोनस ट्री सर्च के लिए डिज़ाइन की गई है। यह स्थापित सर्च विधियों को vLLM-आधारित इनफरेंस पाइलाइन्स और विविध नोड मूल्यांकन तकनीकों के साथ एकीकृत करती है।

arxiv arXiv cs.AI · 26 दिन पहले · 7 बार देखा गया

WILDTRACE लंबे-संदर्ब तर्क में प्राकृतिक प्रमाण पथों के लिए बेंचमार्क पेश करता है

लेखकों ने WILDTRACE पेश किया, एक नया बेंचमार्क जो मॉडलों की लंबे दस्तावेज़ों में दूर-दराज खंडों में बिखरे प्रमाणों को कितनी अच्छी तरह एकीकृत करते हैं, इसका मूल्यांकन करने के लिए डिज़ाइन किया गया है। मौजूदा बेंचमार्क्स के विपरीत जो रोपित तथ्यों या उल्टे-इंजीनियरिंग चेन्स पर निर्भर करते हैं, WILDTRACE 214 प्राकृतिक स्रोतों से व्युत्पन्न 481 कार्यों का उपयोग करता है, जैसे तकनीकी घटना रिपोर्ट और साहित्यिक कथाएँ।

arxiv arXiv cs.LG · 27 दिन पहले

न्यूरल कॉलाप्स पर प्रतिबंध है: भाषा मॉडलों में जानकारी की तल

लेख का तर्क है कि भाषा मॉडल निरूपणों में वर्ग-अंदर भिन्नता अधूरी न्यूरल कॉलाप्स नहीं बल्कि एक विशिष्ट नियम द्वारा शासित आवंटित जानकारी संग्रह है। 14 मॉडलों का विश्लेषण दिखाता है कि मैक्रो-श्रेणी संरचना केवल निरूपणात्मक भिन्नता का 4-12% खाता है, जबकि टोकन-अंदर संदर्भ 79-91% ले जाता है, जो 100x पैरामीटर श्रृंखला में स्थिर रहता है।

arxiv arXiv cs.AI · 27 दिन पहले

स्थिर निरूपणों से परे: ओपन-एंडेड AI में शब्दावली और सत्यापक की कमी

यह पेपर तर्क देता है कि ओपन-एंडेड नवाचार की क्षमता वाले मजबूत बुद्धिमान सिस्टम बनाने के लिए स्थिर फ्रेम के भीतर खोजने के बजाय नए निरूपणात्मक प्राइमिटिव्स को बनाना, स्थिर करना और पुनः उपयोग करना आवश्यक है।