Robotics
lab NVIDIA Research · 3 दिन पहले · 5 बार देखा गया

ROSA साझा GPU-पूल सर्विंग के माध्यम से कार्यात्मक उत्पादकता को 12.06x तक बढ़ाता है

शोधकर्ताओं ने ROSA का प्रस्ताव रखा, जो एक रोबोटिक्स फाउंडेशन मॉडल सर्विंग सिस्टम है जो रोबोट कारखानों के लिए डिज़ाइन किया गया है और जो एकल-रोबोट, एज-कंप्यूटिंग मान्यताओं से परे जाता है। यह सिस्टम साझा GPU-पूल सर्विंग का उपयोग करता है ताकि रोबोटों के बेड़े नेटवर्क के माध्यम से सर्वर-क्लास GPUs तक पहुंच सकें।

media Hugging Face Forums · 7 दिन पहले

Calibra v0.7.1 रोबोट लर्निंग के लिए डेटासेट अखंडता जाँच जोड़ता है

Calibra v0.7.1 एक नया डेटासेट अखंडता चरण पेश करता है जो गुणवत्ता और कवरेज विश्लेषण से पहले चलता है ताकि उपयोगकर्ताओं को यह सत्यापित करने में मदद मिल सके कि उनकी रोबोटिक्स डेटासेट विश्वसनीय हैं या नहीं।

media MarkTechPost · 9 दिन पहले · 2 बार देखा गया

गूगल डीपमाइंड ने व्हीोल बॉडी कंट्रोल और दक्षता के लिए जेमिनी रोबोटिक्स 2 जारी किया

गूगल डीपमाइंड ने जेमिनी रोबोटिक्स 2 जारी किया है, जो तीन मॉडलों से मिलकर बना एक इंटेलिजेंस लेयर है जिसका उद्देश्य व्हीोल-बॉडी कंट्रोल, पांच-फिंगर दक्षता और मल्टी-रोबोट सहयोग को सक्षम बनाना है। इस रिलीज़ में एक विजन-लैंग्वेज-एक्शन (VLA) मॉडल, एक एम्बॉडीड रीजनिंग VLM, और एक ऑन-डिवाइस VLA शामिल हैं, जो पिछले टेबल-टॉप मैनिपुलेशन क्षमताओं से आगे बढ़ते हैं।

lab Google DeepMind Blog · 10 दिन पहले · 4 बार देखा गया

Google ने पूरे शरीर के नियंत्रण और बहु-रोबोट सहयोग के लिए Gemini Robotics 2 पेश किया

Google ने Gemini Robotics 2 पेश किया है, एक बुद्धिमत्ता परत जो अनुकूलन योग्य रोबोटों को पूर्ण शरीर का बुद्धिमान नियंत्रण, उन्नत कुशलता और टीमों में सहयोग करने की क्षमता प्रदान करने के लिए डिज़ाइन की गई है। यह अपडेट भौतिक AI क्षमताओं को संकीर्ण, दोहराए जाने वाले कार्यों से परे बढ़ा देता है, रोबोटों को गति के बारे में तर्क करने और नए शरीरों में जल्दी अनुकूलित करने की अनुमति देता है।

lab Google DeepMind Blog · 10 दिन पहले · 9 बार देखा गया

गूगल ने वीडियो समझ और मल्टी-रोबोट सहयोग के साथ गेमिनी रोबोटिक्स ER 2 लॉन्च किया

गूगल ने गेमिनी रोबोटिक्स ER 2 लॉन्च किया है, जो एक नया एंबोडेड रीजनिंग मॉडल है जिसे डिज़ाइन किया गया है ताकि रोबोट तेजी से सोच सकें और वास्तविक समय में मल्टी-स्टेप टास्क की योजना बना सकें। इस अपडेट में पिछले ER 1.6 संस्करण के मुकाबले महत्वपूर्ण सुधार शामिल हैं, जिनमें निरंतर वीडियो-आधारित प्रगति ट्रैकिंग, सटीक मोमेंट-फाइंडिंग और नेटिव मल्टी-रोबोट सहयोग क्षमताएं शामिल हैं।

media Hugging Face Forums · 12 दिन पहले

LeRobot के लिए Calibra: रोबोट डेटासेट ऑब्जर्वेबिलिटी

Calibra एक ओपन-सोर्स टूलकिट है जो प्रशिक्षण से पहले रोबोट डेटासेट की ऑडिट करने और गुणवत्ता समस्याओं को पहचानने के लिए डिज़ाइन किया गया है। यह गुणवत्ता-जागरूक कोरसेट बनाने और प्रशिक्षण परिणामों का अनुमान लगाने के लिए उपकरण प्रदान करता है।

media Hugging Face Forums · 12 दिन पहले · 2 बार देखा गया

Calibra: रोबोट डेटासेट ऑब्जर्वेबिलिटी के लिए ओपन-सोर्स टूलकिट

Calibra एक ओपन-सोर्स टूलकिट है जो शोधकर्ताओं को नीतियों को प्रशिक्षित करने से पहले रोबोट डेटासेट की ऑडिट करने और गुणवत्ता समस्याओं की पहचान करने में मदद करने के लिए डिज़ाइन किया गया है। पहले सार्वजनिक रिलीज में LeRobot डेटासेट की ऑडिट करने के लिए एक इंटरैक्टिव स्पेस Robot Dataset Health Check और स्वास्थ्य स्कोर के साथ 30 सार्वजनिक LeRobot डेटासेट का एक बेंचमार्क शामिल है।

lab Meta AI / FAIR Blog · 13 दिन पहले · 3 बार देखा गया

पिट्सबर्ग विश्वविद्यालय ने ARPA-H द्वारा वित्त पोषित RAMMP सहायक रोबोट के लिए Meta के DINOv3 और SAM का उपयोग किया

पिट्सबर्ग विश्वविद्यालय के ह्यूमन इंजीनियरिंग रिसर्च लैबोरेटरीज (HERL) रोबोटिक असिस्टिव मोबिलिटी एंड मैनिपुलेशन प्लेटफॉर्म प्रोवाइडिंग इंडिपेंडेंस फॉर पीपल विद डिसेबिलिटीज (RAMMP) का नेतृत्व कर रहे हैं, जिसके लिए ARPA-H से 41.5 मिलियन डॉलर तक के वित्त पोषण की सुविधा है। इस पहल का उद्देश्य उन्नत रोबोटिक्स को Meta के ओपन-सोर्स AI विजन मॉडल्स के साथ एकीकृत करके व्हीलचेयर उपयोगकर्ताओं के लिए अधिक सुरक्षित और अनुकूलन योग्य सहायक मोबिलिटी समाधान बनाना है।

lab Hugging Face Blog · 13 दिन पहले · 19 बार देखा गया

NVIDIA ने Cosmos-H-Dreams का परिचय दिया, जो शल्य चिकित्सा रोबोटिक्स के लिए एक रियल-टाइम जनरेटिव सिमुलेटर है

NVIDIA ने Cosmos-H-Dreams का परिचय दिया, जो शल्य चिकित्सा रोबोटिक्स के लिए एक रियल-टाइम, एक्शन-कंडीशन्ड जनरेटिव सिमुलेटर है जो Cosmos-H-Surgical-Simulator की क्षमताओं को एक काज़ुअल स्टूडेंट मॉडल में संक्षिप्त करता है। NVIDIA के FlashDreams त्वरित स्ट्रीमिंग-इनफरेंस लाइब्रेरी के माध्यम से सेवा प्राप्त करते हुए, यह सिस्टम बंद लूप में एक व्यक्ति या सीखी गई पॉलिसी द्वारा इंटरैक्टिव कंट्रोल को सक्षम बनाता है।

media Latent Space · 16 दिन पहले · 4 बार देखा गया

Black Forest Labs ने FLUX 3 मल्टीमोडल फ्लो मॉडल्स और FLUX-mimic रोबोटिक्स मॉडल जारी किए

Black Forest Labs ने FLUX 3 लॉन्च किया है, जो एक मल्टीमोडल फ्लो मॉडल फैमिली है जिसमें नैटिव ऑडियो के साथ वीडियो जनरेशन क्षमताएं शामिल हैं। इस रिलीज़ में FLUX-mimic भी पेश किया गया है, जो वीडियो-एक्शन रोबोटिक्स अनुप्रयोगों के लिए डिज़ाइन किया गया एक वेरिएंट है।

lab Hugging Face Blog · 19 दिन पहले · 8 बार देखा गया

भौतिक एआई के लिए सिमुलेशन इंजन: MuJoCo, Isaac Sim, और Newton का अवलोकन

यह लेख भौतिक एआई में सिमुलेशन की वर्तमान स्थिति का अवलोकन प्रदान करता है, यह समझाते हुए कि सिमुलेशन स्केलेबल, फोटोरियलिस्टिक प्रशिक्षण वातावरण को सक्षम बनाकर रोबोटिक्स के लिए डेटा अंतर को कैसे पूरा करता है। यह तीन-कंप्यूटर परिसर (प्रशिक्षण, सिमुलेशन, ऑन-रोबोट) का विवरण देता है और उनकी विशिष्ट क्षमताओं और उपयोग मामलों के आधार पर प्रमुख सिमुलेशन इंजन को वर्गीकृत करता है।

media MarkTechPost · 19 दिन पहले · 4 बार देखा गया

NVIDIA ने Cosmos 3 Edge जारी किया, ऑन-डिवाइस रोबोट तर्क के लिए एक 4B ओपन वर्ल्ड मॉडल

NVIDIA ने Cosmos 3 Edge जारी किया है, जो रोबोटों और विजन AI एजेंट्स पर ऑन-डिवाइस चलने के लिए डिज़ाइन किया गया एक 4-अरब पैरामीटर वाला ओपन वर्ल्ड मॉडल है। Hugging Face पर 20 जुलाई को जारी, यह सिस्टमों को आसपास के वातावरण को समझने, रियल-टाइम में तर्क करने और क्लाउड निर्भरता के बिना स्थानीय रूप से रोबोट एक्शन जनरेट करने की क्षमता प्रदान करता है।

lab Hugging Face Blog · 19 दिन पहले · 2 बार देखा गया

Pollen Robotics ने Grabette जारी किया, एक खुला कम-लागत का सिस्टम रिकॉर्ड करने के लिए रोबोट-मैनिपुलेशन डेटा

Pollen Robotics ने Grabette जारी किया है, एक ओपन-सोर्स हैंडहेल्ड डिवाइस जो वास्तविक दुनिया के रोबोट मैनिपुलेशन डेटा को रिकॉर्ड करने के लिए बनाया गया है, बिना किसी रोबोट या टेलीऑपरेशन रिग की आवश्यकता के। सिस्टम 6-DoF ट्रैजेक्टरीज को कैप्चर करने के लिए एक फिशआई कैमरा और एक RGBD डेप्थ कैमरा का उपयोग करता है, जिससे उपयोगकर्ता साफ़ डेटासेट जनरेट कर सकते हैं जिन्हें ब्राउज़र-आधारित डैशबोर्ड के माध्यम से प्रोसेस किया जा सकता है और Hugging Face Hub पर शेयर किया जा सकता है।

lab Hugging Face Blog · 20 दिन पहले · 1 बार देखा गया

NVIDIA ने Cosmos 3 Edge जारी किया, एक 4B-पैरामीटर मॉडल जो एज डिवाइसों पर रियल-टाइम रोबोट नियंत्रण के लिए है

NVIDIA ने Cosmos 3 Edge जारी किया है, जो एक 4-अरब-पैरामीटर ओपन वर्ल्ड मॉडल है जिसे मेमोरी-सीमित एज सिस्टम पर डेटा सेंटर-स्तर का प्रदर्शन प्रदान करने के लिए डिज़ाइन किया गया है। यह मॉडल रोबोटों और विजन AI एजेंट्स को अपने आसपास के वातावरण को समझने, रियल-टाइम में तर्क करने और NVIDIA Jetson मॉड्यूल जैसे डिवाइसों पर सीधे एक्शन जनरेट करने में सक्षम बनाता है।

media MarkTechPost · 23 दिन पहले

Mistral AI ने सिंगल-कैमरा रोबोट नेविगेशन के लिए 8B मॉडल Robostral Navigate जारी किया

Mistral AI ने Robostral Navigate जारी किया है, जो एकमात्र RGB कैमरे का उपयोग करके एम्बेडेड नेविगेशन के लिए डिज़ाइन किया गया उनका पहला मॉडल है। 8B-पैरामीटर वाला मॉडल साधारण भाषा में दिए गए निर्देशों और छवि इनपुट को स्वीकार करता है ताकि कार्यालयों और बाहरी स्थानों जैसे जटिल वातावरण में रोबोट्स का मार्गदर्शन किया जा सके।

arxiv arXiv cs.LG · 23 दिन पहले · 2 बार देखा गया

RoboTTT 8K-टिम्स्टेप संदर्भ के लिए रोबोट पॉलिसीज़ को स्केल करता है

शोधकर्ताओं ने RoboTTT का परिचय दिया, एक प्रशिक्षण विधि जो रोबोट फाउंडेशन मॉडल्स के लिए विसुओमोटर संदर्भ को 8,000 टिम्स्टेप्स तक बढ़ाती है बिना इनफरेंस लेटेंसी बढ़ाए। यह विधि वीजन-लैंग्वेज-एक्शन पॉलिसीज़ में टेस्ट-टाइम ट्रेनिंग को एकीकृत करती है, जिसमें ग्रेडिएंट डेसेंट के माध्यम से अपडेट किए जाने वाले फास्ट वेइट्स का उपयोग प्रशिक्षण और इनफरेंस दोनों के दौरान किया जाता है।

arxiv arXiv cs.AI · 23 दिन पहले

RoboTTT रॉबोट पॉलिसीज़ को 8K-टाइमस्टेप संदर्भ तक स्केल करता है

NVIDIA ने RoboTTT का परिचय दिया, जो एक रॉबोट फाउंडेशन मॉडल और प्रशिक्षण विधि है जो इनफरेंस लेटेंसी को बढ़ाए बिना विसुओमोटर संदर्भ को 8,000 टाइमस्टेप्स तक बढ़ाता है। टेस्ट-टाइम ट्रेनिंग को विजन-लैंग्वेज-एक्शन पॉलिसीज़ में एकीकृत करके, सिस्टम ग्रेडिएंट डाउनद्वारा अपडेट किए जाने वाले फास्ट वेइट्स का उपयोग करके इतिहास को वेट स्पेस में संकुचित करता है।

arxiv arXiv cs.AI · 23 दिन पहले SWE-bench Pro · 63.2%

Xiaomi ने एकीकृत शारीरिक संश्लेषण के लिए 38B-पैरामीटर का मॉडल U0 जारी किया

Xiaomi ने Xiaomi-Robotics-U0 पेश किया, जो एक 38-अरब-पैरामीटर बहुमोडल ऑटोरिग्रेसिव मॉडल है जो एकीकृत शारीरिक संश्लेषण के लिए डिज़ाइन किया गया है। यह मॉडल शारीरिक जनरेशन को मौलिक छवि और वीडियो जनरेशन का विस्तार मानता है, टेक्स्ट-टू-इमेज जनरेशन, छवि संपादन, शारीरिक दृश्य जनरेशन, शारीरिक स्थानांतरण और शारीरिक वीडियो जनरेशन को संयुक्त रूप से अनुकूलित करता है।

arxiv arXiv cs.AI · 27 दिन पहले · 1 बार देखा गया

PAC-ACT पोस्ट-ट्रेनिंग फ्रेमवर्क सटीक संपर्क मैन्युपुलेशन के लिए ACT पॉलिसियों को सुधारता है

यह पेपर PAC-ACT का परिचय देता है, जो एक रीइन्फोर्समेंट-लर्निंग पोस्ट-ट्रेनिंग फ्रेमवर्क है जिसे औद्योगिक सटीक-संपर्क कार्यों के लिए प्री-ट्रेन किए गए Action Chunking Transformer (ACT) पॉलिसियों को बढ़ाने के लिए डिज़ाइन किया गया है। विधि चंक स्तर पर पॉलिसी अनुकूलन को पुनः परिभाषित करती है और एक हाइब्रिड व्यवहार-प्रायर बाधा के साथ ACT-ट्रांसफर किए गए एक्टर-क्रिटिक आर्किटेक्चर का उपयोग करती है।

lab NVIDIA Technical Blog · 28 दिन पहले · 1 बार देखा गया

NVIDIA ने सामान्य-उद्देश्य वाले रोबोट पॉलिसी का मूल्यांकन करने के लिए एक विधि पेश की

NVIDIA उन चुनौतियों को संबोधित कर रहा है जो रोबोटिक्स फाउंडेशन मॉडल के कठोर मूल्यांकन से जुड़ी हैं, जो अब प्राकृतिक भाषा निर्देशों का पालन करके वस्तुओं को संभाल सकते हैं। कंपनी ने मूल्यांकन को एक महत्वपूर्ण और अटल समस्या के रूप में पहचाना है और इन मुद्दों को हल करने के लिए एक नई विधि प्रस्तुत की है।