विषय · Training data
lab IBM Research (Granite) · 29 दिन पहले HumanEval · 83.5% · 2 बार देखा गया

IBM ने उच्च-गुणवत्ता वाले कोड के विशाल संश्लेषित डेटासेट CodeAlchemy को ओपन-सोर्स किया

IBM ने CodeAlchemy को ओपन-सोर्स किया, जो एक पाइपलाइन और संश्लेषित डेटासेट है जिसे कोड को एक्जीक्यूशन ट्रेस के साथ जोड़कर AI मॉडल की प्रदर्शन क्षमता को बेहतर बनाने के लिए डिज़ाइन किया गया है। इस रिलीज में 15 प्रोग्रामिंग भाषाओं में लगभग 1 ट्रिलियन टोकन शामिल हैं, जो कुल मिलाकर विकिपीडिया के आकार से कम से कम 200 गुना अधिक है।

media Hugging Face Forums · 4 घंटे पहले · 1 बार देखा गया

helloadhavan ने Common Crawl से संरचित Markdown निकालने के लिए CC-FilteredCorpus जारी किया

उपयोगकर्ता helloadhavan ने CC-FilteredCorpus नाम का एक डेटासेट बनाया है, जो Common Crawl को फ़िल्टर करने और सामग्री को साफ़ Markdown के रूप में निकालने के लिए डिज़ाइन किया गया है। परियोजना का उद्देश्य उपयोगी दस्तावेज़ संरचना को बनाए रखना है, जिसमें शीर्षक, सूचियाँ, लिंक, कोड ब्लॉक और तालिकाएं शामिल हैं, न कि सब कुछ को सादे पाठ में बदल देना।

media Hugging Face Forums · 2 दिन पहले · 11 बार देखा गया

Calibra रोबोट-लर्निंग डेटासेट में समस्याओं का पता लगाता है

लेखक Calibra का परिचय देते हैं, जो एक ओपन-सोर्स टूलकिट है जो रोबोट-लर्निंग डेटासेट के विश्लेषण और अखंडता को सुनिश्चित करने के लिए डिज़ाइन किया गया है। यह टूल प्रशिक्षण शुरू होने से पहले समस्याग्रस्त डेटा की पहचान करके बर्बाद कंप्यूट को रोकने का लक्ष्य रखता है।

media Hugging Face Forums · 12 दिन पहले · 8 बार देखा गया

OpenGauntlet ने 168 TTS और 106 STT प्रणालियों का कैटलॉग प्रकाशित किया

एक शोधकर्ता ने OpenGauntlet शोध कैटलॉग प्रकाशित किया है, जो 168 टेक्स्ट-टू-स्पीच (TTS) प्रणालियों और 106 स्पीच-टू-टेक्स्ट (STT) प्रणालियों के बारे में जानकारी वाला एक सार्वजनिक संसाधन है। डायरेक्ट्रीज़ ओपन और होस्टेड मॉडल्स, लाइसेंसिंग, हार्डवेयर आवश्यकताओं, भाषाओं, क्षमताओं, जीवन चक्र की स्थिति, स्रोत जानकारी और उपलब्ध होने पर प्रकाशित बेंचमार्क डेटा को कवर करती हैं।

media Hugging Face Forums · 13 दिन पहले · 12 बार देखा गया

मासिक अनुपालन मैट्रिक्स दिखाता है कि 4,893 इंडिक डेटासेट में से 65% में लाइसेंस टैग नहीं हैं

Hugging Face Hub पर सभी 4,893 इंडिक-भाषा डेटासेट के लिए एक मासिक-अपडेट किया गया अनुपालन मैट्रिक्स प्रकाशित किया गया है, जिसमें यह पता चला है कि 1 अगस्त 2026 तक 65.1% ने कोई लाइसेंस टैग घोषित नहीं किया है।

media Hugging Face Forums · 13 दिन पहले · 5 बार देखा गया

Calibra v0.7.1 रोबोट लर्निंग के लिए डेटासेट अखंडता जाँच जोड़ता है

Calibra v0.7.1 एक नया डेटासेट अखंडता चरण पेश करता है जो गुणवत्ता और कवरेज विश्लेषण से पहले चलता है ताकि उपयोगकर्ताओं को यह सत्यापित करने में मदद मिल सके कि उनकी रोबोटिक्स डेटासेट विश्वसनीय हैं या नहीं।

media Hugging Face Forums · 17 दिन पहले · 3 बार देखा गया

Calibra: रोबोट डेटासेट ऑब्जर्वेबिलिटी के लिए ओपन-सोर्स टूलकिट

Calibra एक ओपन-सोर्स टूलकिट है जो शोधकर्ताओं को नीतियों को प्रशिक्षित करने से पहले रोबोट डेटासेट की ऑडिट करने और गुणवत्ता समस्याओं की पहचान करने में मदद करने के लिए डिज़ाइन किया गया है। पहले सार्वजनिक रिलीज में LeRobot डेटासेट की ऑडिट करने के लिए एक इंटरैक्टिव स्पेस Robot Dataset Health Check और स्वास्थ्य स्कोर के साथ 30 सार्वजनिक LeRobot डेटासेट का एक बेंचमार्क शामिल है।

media Hugging Face Forums · 18 दिन पहले · 31 बार देखा गया

Huggy Engine ने Huggy Database जारी किया, जो सबसे बड़ा खुला फ्रेंच घुड़सवारी डेटासेट है

Huggy Engine ने Hugging Face पर Huggy Database प्रकाशित किया है, जिसे उपलब्ध सबसे बड़े खुले फ्रेंच घुड़सवारी डेटासेट के रूप में वर्णित किया गया है। इस रिलीज में मशीन लर्निंग अनुप्रयोगों के लिए 1996 से 2026 तक 30 वर्षों की पूर्ण दैनिक कवरेज प्रदान करता है।

media r/LocalLLaMA · 21 दिन पहले · 15 बार देखा गया

Hugging Face ने The Stack v3 जारी किया, सबसे बड़ा ओपन कोड डेटासेट

Hugging Face ने The Stack v3 जारी किया है, जिसे अब तक का सबसे बड़ा ओपन कोड डेटासेट बताया गया है। रिलीज में विभिन्न उपयोगकर्ताओं की आवश्यकताओं को पूरा करने के लिए दो अलग-अलग एक्सेस तरीके प्रदान किए गए हैं।

media Hugging Face Forums · 28 दिन पहले · 4 बार देखा गया

louidev ने Gemini पूर्वानुमानों का एक समय-बद्ध डेटासेट GlassBallAI जारी किया है, जो LLM व्यवहार का अध्ययन करने के लिए है

louidev ने Hugging Face पर GlassBallAI डेटासेट जारी किया है, जिसमें परिणामों के ज्ञात होने से पहले Google के Gemini मॉडलों से लाइव पूर्वानुमान व्यवहार को कैप्चर किया गया है। इस डेटासेट में 17 फरवरी और 19 मई 2026 के बीच एकत्रित 3,655 से अधिक पंक्तियों का डेटा शामिल है, जिसमें Gemini 2.5 Flash, 2.5 Pro, 2.5 Flash Lite और 3.0 Flash Preview शामिल हैं।

media Hugging Face Forums · 30 दिन पहले · 1 बार देखा गया

वैज्ञानिक ML सिमुलेशन में डेटा बॉटलनेक को संभालने पर चर्चा

एक उपयोगकर्ता भौतिक सिमुलेशन (जैसे तरल प्रवाह और संरचनात्मक क्षेत्र) से प्रशिक्षण डेटासेट उत्पन्न करने की गणनात्मक लागत के अपने अनुभव साझा करता है। वह इस बात पर जोर देता है कि मुख्य चुनौती मॉडल आर्किटेक्चर नहीं, बल्कि एक बड़े और विविध डेटासेट बनाने की कठिनाई है जब प्रत्येक नमूना बनाना महंगा है।