AI agents
media TLDR AI · 2 घंटे पहले · 10 बार देखा गया

Anthropic ने Claude Projects v2 जारी किया; Google ने परिवार एजेंट पेश किया

Anthropic ने Claude Projects v2 जारी किया है, फ़ोल्डर-आधारित संरचना से बातचीत-संचालित इंटरफ़ेस में फीचर को फिर से डिज़ाइन किया जो कार्य सौंपने और समानांतर थ्रेड के माध्यम से बिल्ड्स का प्रबंधन करता है। इसी समय, Google एक परिवार एजेंट का परीक्षण कर रहा है जो छह घर के सदस्यों के लिए गतिविधियों को समन्वयित करने के लिए समर्पित क्लाउड कंप्यूटर पर काम करता है।

media TLDR AI · 2 घंटे पहले AIME 2024 · 50.0% · 9 बार देखा गया

मेटा ने Muse कनेक्टर खोले, SAM 3.1 जारी किया, और Gemini ने सिस्टम हैक किए

यह अपडेट AI परिदृश्य में कई विकास को कवर करता है, जिसमें मेटा द्वारा अपनी Muse प्लेटफ़ॉर्म को तीसरे पक्ष के डेवलपर्स के लिए खोलना, अपने सेगमेंटेशन मॉडल का नया संस्करण जारी करना और Google के Gemini से जुड़ा एक सुरक्षा घटना शामिल है।

media TLDR AI · 2 घंटे पहले · 10 बार देखा गया

Xiaomi ने MiMo-V2.6 Pro और Flash मॉडल ओपन-सोर्स किए

Xiaomi ने MiMo-V2.6 Pro और Flash ओमिमोडल मॉडल ओपन-सोर्स किए हैं, जो इंटरैक्टिव 3D सीन्स को बनाने और दृश्य रूप से परीक्षण करने के लिए एजेंट्स को समन्वयित करने के लिए डिज़ाइन किए गए हैं। ये मॉडल Blender संपत्तियाँ उत्पन्न कर सकते हैं, कैमरा फ़ीड से रोबोटिक आर्म को नियंत्रित कर सकते हैं, फ्रंटएंड और प्रस्तुतियाँ बना सकते हैं, वीडियो एसेंबल कर सकते हैं और संगीत को स्कोर और MIDI के रूप में संयोजित कर सकते हैं।

arxiv arXiv cs.AI · 2 घंटे पहले · 9 बार देखा गया

AIDE^2 एआई शोध एजेंट्स के पुनरावर्ती स्वयं-सुधार को सक्षम बनाता है

शोधकर्ताओं ने AIDE^2 प्रस्तुत किया, एक सिस्टम जो अपने स्वयं के कोड को अनुकूलित करके एआई शोध एजेंट के लिए पुनरावर्ती स्वयं-सुधार की लूप लागू करता है। सिस्टम अपनी आंतरिक तर्क में परिवर्तन सुझाता है, AI R&D कार्यों पर संशोधित संस्करणों का मूल्यांकन करता है, और केवल उन सुधारों को बनाए रखता है जो छिपे हुए मूल्यांकनों पर सबसे अच्छा प्रदर्शन करते हैं।

arxiv arXiv cs.AI · 3 घंटे पहले WebArena · 45.3% · 13 बार देखा गया

Growing Harness दोहराए जाने वाले एजेंट नियंत्रण को विफलता-मार्गदर्शित प्रशिक्षण के माध्यम से पुनः उपयोग योग्य कोड में बदलता है

लेखकों ने Growing Harness पेश किया, जो एक प्रशिक्षण पैराडाइम है जो कार्य फीडबैक से एजेंट के नियंत्रण संरचना को सीखता है, न कि भारी संदर्भ वाले हार्नेस पर निर्भर रहकर। दोहराए जाने वाले नियंत्रण निर्णयों को निष्पादन योग्य कोड में बदलकर और अर्थपूर्ण तर्क के लिए LLM कॉल को सुरक्षित रखकर, इस विधि का उद्देश्य पुनः उपयोग योग्य विशेषज्ञ एजेंट बनाना है।

arxiv arXiv cs.AI · 4 घंटे पहले · 9 बार देखा गया

क्लिफकंपैक्शन कोडिंग एजेंट के खर्चों को 50% कम करता है जबकि प्रदर्शन बनाए रखता है

शोधकर्ताओं ने क्लिफकंपैक्शन पेश किया, एक ऑटोकंपैक्शन तकनीक जो बाउंडेड कॉन्टेक्स्ट के तहत लॉन्ग-होराइजन कोडिंग एजेंट्स के लिए खर्चों को 50% तक कम करने के लिए डिज़ाइन की गई है। विधि टर्मिनल-बेंच पर प्रदर्शन बनाए रखती या सुधारती है और ट्रंकेशन के माध्यम से न कि पुनः वाक्य रचना के माध्यम से संपीड़ित जानकारी को विश्वसनीय रखकर कर्नेलबेंच पर शीर्ष-प्रदर्शन प्राप्त करती है।

arxiv arXiv cs.LG · 4 घंटे पहले · 11 बार देखा गया

AIDE^2 एआई शोध एजेंट्स के पुनरावर्ती स्वयं-सुधार को सक्षम बनाता है

शोधकर्ताओं ने AIDE^2 प्रस्तुत किया, एक सिस्टम जो अपने स्वयं के कोड को अनुकूलित करके एक फ्रंटियर एआई शोध एजेंट के लिए पुनरावर्ती स्वयं-सुधार की लूप लागू करता है। सिस्टम अपने आंतरिक तर्क में परिवर्तन सुझाता है, एआई R&D कार्यों पर संशोधित संस्करणों का बेंचमार्किंग करता है, और केवल उन अपडेट्स को ही बनाए रखता है जो छिपे हुए मूल्यांकनों पर सबसे अच्छा प्रदर्शन करते हैं।

arxiv arXiv cs.LG · 5 घंटे पहले · 9 बार देखा गया

क्लिफकंपैक्शन लंबे-अवधि कोडिंग एजेंट के खर्चों को 50% तक कम करता है, प्रदर्शन बनाए रखते हुए

शोधकर्ताओं ने क्लिफकंपैक्शन पेश किया, एक ऑटोकंपैक्शन तकनीक जो लाखों टोकन संभालने वाले एजेंट्स के लिए डिज़ाइन की गई है, जो सीमित संदर्भ में खर्चों को 50% तक कम करती है। विधि टर्मिनल-बेंच पर प्रदर्शन बनाए रखती या सुधारती है और पुनः वर्णन करने के बजाय जानकारी को सटीक रखकर कर्नेलबेंच पर शीर्ष स्तर का परिणाम प्राप्त करती है।

arxiv arXiv cs.CL · 7 घंटे पहले · 12 बार देखा गया

Agensh संगठनात्मक बुद्धिमत्ता को 1,024 एजेंट्स तक स्केल करता है

शोधकर्ताओं ने Agensh का परिचय दिया, एक स्केलेबल स्व-संगठित मल्टी-एजेंट हार्नेस जो समवर्ती कार्यकर्ताओं को उप-कार्यों को असिंक्रोनस रूप से दावा करने और प्रगति को विलय करने की अनुमति देकर केंद्रीय ऑर्केस्ट्रेटर बॉटलनेक को समाप्त करता है।

arxiv arXiv cs.CL · 7 घंटे पहले · 11 बार देखा गया

Qwen ने Qwen3.8-Omni-Flash जारी किया, जो 1M टोकन संदर्भ के साथ एक स्थानीय बहुआयामी एजेंटिक मॉडल है

Alibaba Cloud ने Qwen3.8-Omni-Flash का परिचय दिया, जो एक स्वदेशी बहुआयामी एजेंटिक मॉडल है जो वास्तविक दुनिया की उत्पादकता कार्यों के लिए डिज़ाइन किया गया है और पिछले omni मॉडलों की तुलना में बहुआयमी समझ और तर्कशीलता को काफी बेहतर बनाता है।

lab xAI News · 10 घंटे पहले · 15 बार देखा गया

SpaceXAI ने Grok Bot का उपयोग करके बिना नई भर्ती के 175% टिकट वृद्धि को संभाला

Cursor अधिग्रहण के बाद SpaceXAI ने अपने एकीकृत ग्राहक सहायता परिचालन में अपने Grok Bot AI एजेंट को एकीकृत किया, जिससे टीम ने बिना कर्मचारियों की संख्या बढ़ाए 175% समर्थन टिकटों की वृद्धि का प्रबंधन किया। कंपनी ने लगभग 200 अतिरिक्त कर्मचारियों की भर्ती से बचने के साथ-साथ Grok Bot के उपयोग-आधारित मूल्य निर्धारण मॉडल का लाभ उठाकर प्रति टिकट $0.20 और $0.30 के बीच समाधान लागत को कम किया।

lab OpenAI News · 11 घंटे पहले · 16 बार देखा गया

GPT-6 Astra का उपयोग करके शोध के समय और लागत को आधा करें

पैरलल ने अपनी AI एजेंट इंफ्रास्ट्रक्चर में OpenAI के GPT-6 Astra को एकीकृत किया है, जिससे पिछली मॉडलों की तुलना में शोध के समय और कोड लागत दोनों में 50% की कमी आई है। कंपनी का कहना है कि नई मॉडल एजेंटों को उच्च गुणवत्ता वाले आउटपुट बनाए रखते हुए जटिल ज्ञान कार्य को काफी तेजी से पूरा करने की अनुमति देती है।

lab OpenAI News · 13 घंटे पहले · 22 बार देखा गया

OpenAI ने GPT-6 प्रॉम्प्ट कैशिंग को उच्च हिट रेट और डायग्नोस्टिक्स के साथ बेहतर बनाया

OpenAI ने GPT-6 फ़ैमिली के लिए एक सुधारा हुआ प्रॉम्प्ट कैशिंग सिस्टम लॉन्च किया है जो डिफ़ॉल्ट रूप से उच्च कैश हिट रेट प्रदान करता है और कैश्ड इनपुट टोकन पर 90% तक की छूट देता है। इस अपडेट में डेवलपर्स को प्रदर्शन की निगरानी करने, मिस को डिagnose करने और अपनी इंटीग्रेशन को अनुकूलित करने में मदद करने के लिए नए टूल्स शामिल हैं।

lab Claude Code Releases · 16 घंटे पहले · 14 बार देखा गया

Claude Code v2.1.280 में Claude Opus 5.5 जोड़ा गया और कई बग ठी किए गए

Claude Code संस्करण 2.1.280 ने नए डिफ़ॉल्ट Opus मॉडल के रूप में Claude Opus 5.5 पेश किया है, जिसमें 1M संदर्भ विंडो और अद्यतन मूल्य निर्धारण शामिल हैं। इस अपडेट में फुलस्क्रीन मोड में सूचियों को स्क्रॉल करने के लिए माउस व्हील समर्थन भी जोड़ा गया है और MCP टूल विवरण लंबाई सीमाओं की कॉन्फ़िगरेशन की अनुमति दी गई है।

arxiv arXiv cs.AI · 22 घंटे पहले · 11 बार देखा गया

वर्ल्ड स्टेट जनरेटर एजेंट की सफलता बढ़ाने के लिए योजनाओं को सिंथेटिक दुनियाओं से संरेखित करता है

वर्ल्ड स्टेट जनरेटर (WSG) एक मॉडल है जो विफलताओं के बाद अवस्थाओं को पुनः लिखकर भाषा एजेंट की योजनाओं को उनके निष्पादन वातावरण के नियमों से संरेखित रखता है। इसे सात सिंथेटिक डोमेन से निकाले गए 226K ट्रैजेक्टरी पर प्रशिक्षित किया गया है, जहाँ एक प्रोग्राम नियमों को लागू करता है और लक्ष्य की प्राप्ति योग्यता की जाँच करता है।

media Latent Space · 22 घंटे पहले · 11 बार देखा गया

शियाओमी ने 3 मिलियन डॉलर में प्रशिक्षित शीर्ष ओपन-वेट्स ओमिमोडल मॉडल MiMo-V2.6-Pro जारी किया

शियाओमी ने MiMo-V2.6 सीरीज जारी की है, जिसमें MiMo-V2.6-Pro और MiMo-V2.6-Flash सहित नैटिवली ओमिमोडल मॉडल्स शामिल हैं। कंपनी ने MiMo-V2.6-Pro-UltraSpeed भी लॉन्च किया है, जो समान गुणवत्ता पर आउटपुट गति को 20x तक तेज करता है।

media Hugging Face Forums · 1 दिन पहले · 10 बार देखा गया

बहु-एजेंट AI में वितरित प्रतिबंध संगठित पहचान के बिना एजेंटों को नियंत्रित करता है

एक नई विश्लेषण ने बहु-एजेंट प्रणालियों में एक घटना को उजागर किया है जहाँ अलग से नियंत्रित एजेंटों के बीच उत्पन्न संबंधों ने समूह भर में नियंत्रण शक्ति प्राप्त कर ली है। यह तब होता है जब एजेंट स्थायी संदेश और कलाकृतियाँ छोड़ देते हैं जो एक-दूसरे की गति को सीमित करती हैं, जिससे एक प्रभावी वितरित अभिविन्यास बनता है जिसे व्यक्तिगत कार्यों द्वारा निर्दिष्ट नहीं किया गया है।

media Hugging Face Forums · 1 दिन पहले · 10 बार देखा गया

jbsalles LLMs के लिए SelMem, एक चयनात्मक स्मृति प्रणाली का परीक्षण कर रहे हैं

लेखक ने बड़े भाषा मॉडलों (LLMs) के लिए अपूर्ण और पथ-निर्भर स्मृति का परीक्षण करने के लिए SelMem नामक एक Rust प्रोजेक्ट विकसित किया है। यह दृष्टिकोण मानव स्मृति की नकल करता है, एजेंट्स को समय के साथ इंटरैक्शन की पूर्ण प्रतियां स्टोर करने के बजाय स्मृतियों को संकुचित, भूलने और पुनर्निर्मित करने की अनुमति देता है।

arxiv arXiv cs.AI · 1 दिन पहले · 9 बार देखा गया

एजेंटरूटर स्तर-स्तरीय मॉडल रूटिंग के माध्यम से एजेंटिक वर्कफ़्लो लागत को 72% तक कम करता है

शोधकर्ताओं ने एजेंटरूटर का प्रस्ताव दिया, जो एक हल्का क्लासिफायर है जो प्रत्येक कार्य के लिए फ्रंटियर मॉडल का उपयोग करने के बजाय व्यक्तिगत ट्रैजेक्टरी चरणों को उचित मॉडल स्तरों पर रूट करके बहु-चरण एजेंटिक वर्कफ़्लो को अनुकूलित करता है। यह सिस्टम मौजूदा समाधानों की अक्षमता को दूर करता है जो एक ही एजेंट सत्र के भीतर बदलते उप-कार्य जटिलता को नजरअंदाज करते हैं।