Training data
media Hugging Face Forums · 6 दिन पहले

OpenGauntlet ने 168 TTS और 106 STT प्रणालियों का कैटलॉग प्रकाशित किया

एक शोधकर्ता ने OpenGauntlet शोध कैटलॉग प्रकाशित किया है, जो 168 टेक्स्ट-टू-स्पीच (TTS) प्रणालियों और 106 स्पीच-टू-टेक्स्ट (STT) प्रणालियों के बारे में जानकारी वाला एक सार्वजनिक संसाधन है। डायरेक्ट्रीज़ ओपन और होस्टेड मॉडल्स, लाइसेंसिंग, हार्डवेयर आवश्यकताओं, भाषाओं, क्षमताओं, जीवन चक्र की स्थिति, स्रोत जानकारी और उपलब्ध होने पर प्रकाशित बेंचमार्क डेटा को कवर करती हैं।

media Hugging Face Forums · 7 दिन पहले · 1 बार देखा गया

मासिक अनुपालन मैट्रिक्स दिखाता है कि 4,893 इंडिक डेटासेट में से 65% में लाइसेंस टैग नहीं हैं

Hugging Face Hub पर सभी 4,893 इंडिक-भाषा डेटासेट के लिए एक मासिक-अपडेट किया गया अनुपालन मैट्रिक्स प्रकाशित किया गया है, जिसमें यह पता चला है कि 1 अगस्त 2026 तक 65.1% ने कोई लाइसेंस टैग घोषित नहीं किया है।

media Hugging Face Forums · 7 दिन पहले

Calibra v0.7.1 रोबोट लर्निंग के लिए डेटासेट अखंडता जाँच जोड़ता है

Calibra v0.7.1 एक नया डेटासेट अखंडता चरण पेश करता है जो गुणवत्ता और कवरेज विश्लेषण से पहले चलता है ताकि उपयोगकर्ताओं को यह सत्यापित करने में मदद मिल सके कि उनकी रोबोटिक्स डेटासेट विश्वसनीय हैं या नहीं।

media Hugging Face Forums · 12 दिन पहले · 2 बार देखा गया

Calibra: रोबोट डेटासेट ऑब्जर्वेबिलिटी के लिए ओपन-सोर्स टूलकिट

Calibra एक ओपन-सोर्स टूलकिट है जो शोधकर्ताओं को नीतियों को प्रशिक्षित करने से पहले रोबोट डेटासेट की ऑडिट करने और गुणवत्ता समस्याओं की पहचान करने में मदद करने के लिए डिज़ाइन किया गया है। पहले सार्वजनिक रिलीज में LeRobot डेटासेट की ऑडिट करने के लिए एक इंटरैक्टिव स्पेस Robot Dataset Health Check और स्वास्थ्य स्कोर के साथ 30 सार्वजनिक LeRobot डेटासेट का एक बेंचमार्क शामिल है।

media Hugging Face Forums · 12 दिन पहले · 3 बार देखा गया

Huggy Engine ने Huggy Database जारी किया, जो सबसे बड़ा खुला फ्रेंच घुड़सवारी डेटासेट है

Huggy Engine ने Hugging Face पर Huggy Database प्रकाशित किया है, जिसे उपलब्ध सबसे बड़े खुले फ्रेंच घुड़सवारी डेटासेट के रूप में वर्णित किया गया है। इस रिलीज में मशीन लर्निंग अनुप्रयोगों के लिए 1996 से 2026 तक 30 वर्षों की पूर्ण दैनिक कवरेज प्रदान करता है।

media r/LocalLLaMA · 16 दिन पहले · 4 बार देखा गया

Hugging Face ने The Stack v3 जारी किया, सबसे बड़ा ओपन कोड डेटासेट

Hugging Face ने The Stack v3 जारी किया है, जिसे अब तक का सबसे बड़ा ओपन कोड डेटासेट बताया गया है। रिलीज में विभिन्न उपयोगकर्ताओं की आवश्यकताओं को पूरा करने के लिए दो अलग-अलग एक्सेस तरीके प्रदान किए गए हैं।

media Hugging Face Forums · 23 दिन पहले · 3 बार देखा गया

louidev ने Gemini पूर्वानुमानों का एक समय-बद्ध डेटासेट GlassBallAI जारी किया है, जो LLM व्यवहार का अध्ययन करने के लिए है

louidev ने Hugging Face पर GlassBallAI डेटासेट जारी किया है, जिसमें परिणामों के ज्ञात होने से पहले Google के Gemini मॉडलों से लाइव पूर्वानुमान व्यवहार को कैप्चर किया गया है। इस डेटासेट में 17 फरवरी और 19 मई 2026 के बीच एकत्रित 3,655 से अधिक पंक्तियों का डेटा शामिल है, जिसमें Gemini 2.5 Flash, 2.5 Pro, 2.5 Flash Lite और 3.0 Flash Preview शामिल हैं।

lab IBM Research (Granite) · 23 दिन पहले HumanEval · 83.5%

IBM ने उच्च-गुणवत्ता वाले कोड के विशाल संश्लेषित डेटासेट CodeAlchemy को ओपन-सोर्स किया

IBM ने CodeAlchemy को ओपन-सोर्स किया, जो एक पाइपलाइन और संश्लेषित डेटासेट है जिसे कोड को एक्जीक्यूशन ट्रेस के साथ जोड़कर AI मॉडल की प्रदर्शन क्षमता को बेहतर बनाने के लिए डिज़ाइन किया गया है। इस रिलीज में 15 प्रोग्रामिंग भाषाओं में लगभग 1 ट्रिलियन टोकन शामिल हैं, जो कुल मिलाकर विकिपीडिया के आकार से कम से कम 200 गुना अधिक है।

media Hugging Face Forums · 24 दिन पहले

वैज्ञानिक ML सिमुलेशन में डेटा बॉटलनेक को संभालने पर चर्चा

एक उपयोगकर्ता भौतिक सिमुलेशन (जैसे तरल प्रवाह और संरचनात्मक क्षेत्र) से प्रशिक्षण डेटासेट उत्पन्न करने की गणनात्मक लागत के अपने अनुभव साझा करता है। वह इस बात पर जोर देता है कि मुख्य चुनौती मॉडल आर्किटेक्चर नहीं, बल्कि एक बड़े और विविध डेटासेट बनाने की कठिनाई है जब प्रत्येक नमूना बनाना महंगा है।

arxiv arXiv cs.LG · 24 दिन पहले

CSFS से हवा और सौर ऊर्जा भविष्यवाणी के लिए फीचर चयन की लागत में 21% की कमी

शोधकर्ताओं ने क्लस्टर-आधारित क्रमागत फीचर चयन (CSFS) का प्रस्ताव दिया है, जो नवीकरणीय ऊर्जा भविष्यवाणी पाइपलाइन में स्वचालित और कुशल फीचर चयन के लिए एक नया क्लस्टरिंग-आधारित wrapper विधि है। यह दृष्टिकोण उपलब्ध निगरानी और पर्यावरणीय चरों की बड़ी संख्या से इनपुट फीचर्स का चयन करने के लिए व्यवस्थित विधियों की कमी को दूर करता है।

arxiv arXiv cs.AI · 24 दिन पहले

CSFS नवीकरणीय ऊर्जा पूर्वानुमान में 21% की गणनात्मक लागत कम करता है

शोधकर्ताओं ने क्लस्टर-आधारित क्रमिक विशेषता चयन (CSFS) का प्रस्ताव रखा है, जो एक नवीन, मॉडल-अज्ञात व्रैपर विधि है, जो पवन और सौर ऊर्जा पूर्वानुमान में व्यवस्थित विशेषता चयन की कमी को दूर करने के लिए डिज़ाइन की गई है। इस दृष्टिकोण का उद्देश्य नवीकरणीय ऊर्जा पाइपलाइनों के लिए स्वचालित, कुशल और विश्वसनीय विशेषता चयन प्रदान करना है।

arxiv arXiv cs.AI · 24 दिन पहले · 1 बार देखा गया

ViHoRec: गुणवत्ता-नियंत्रित वियतनामी होटल अनुशंका डेटासेट और कोल्ड-स्टार्ट बेंचमार्क

शोधकर्ताओं ने ViHoRec का परिचय दिया, जो वियतनामी होटल अनुशंका के लिए 6,832 उपयोगकर्ताओं और 560 होटलों के बीच 18,267 इंटरैक्शन का एक सार्वजनिक डेटासेट है। संसाधन HMAC पसूडोनॉम का उपयोग करके क्रॉस-प्लेटफ़ॉर्म एंटिटी रिज़ॉल्यूशन और गोपनीयता-संरक्षित रिलीज़ में चुनौतियों को संबोधित करता है।

arxiv arXiv cs.AI · 24 दिन पहले

FormalAnalyticGeo न्यूरो-सिंबोलिक पाइपलाइन के माध्यम से बहुआयामी विश्लेषणात्मक ज्यामिति की समस्याएं उत्पन्न करता है

शोधकर्ता FormalAnalythicGeo पेश करते हैं, जो बहुआयामी विश्लेषणात्मक ज्यामिति की समस्याओं के पूर्णतः स्वचालित उत्पादन के लिए एक स्केलेबल फ्रेमवर्क है जो मानव एनोटेशन की आवश्यकता को समाप्त करता है। सिस्टम CDL नामक एक औपचारिक मध्यवर्ती निरूपण का उपयोग करता है, जो Signed Distance Field इंजन के माध्यम से समस्या पाठ को सटीक आरेख रेंडरिंग से जोड़ता है।

media Hugging Face Forums · 24 दिन पहले

शोधकर्ता डीएनए ओरिगामी का उपयोग करके गोपनीय संदेशों को नैनो-मॉर्स कोड के रूप में एन्कोड कर रहे हैं

शोधकर्ताओं ने बायोमोलिक्युलर क्रिप्टोग्राफी के लिए एक विधि विकसित की है जो डीएनए ओरिगामी का उपयोग करके गोपनीय संदेशों को नैनो-मॉर्स कोड में बदलती है। यह दृष्टिकोण पारंपरिक कंप्यूटर-आधारित क्रिप्टोग्राफिक एल्गोरिदम के बजाय जैविक अणुओं का उपयोग करके जानकारी को सुरक्षित करने का लक्ष्य रखता है।

media Hugging Face Forums · 26 दिन पहले · 2 बार देखा गया

निर्माता भावनाओं के लंबकोणीय मॉडल से इमोजी भावना डेटासेट व्युत्पन्न करता है

एक उपयोगकर्ता ने 'भावनाओं के लंबकोणीय मॉडल' पर आधारित एक व्युत्पन्न डेटासेट बनाया है, जिसमें एक आयाम को हटाकर और अस्तित्ववादी क्लस्टर लेबल को 10 इमोजी श्रेणियों से बदल दिया गया है।

arxiv arXiv cs.CL · 26 दिन पहले · 1 बार देखा गया

शोधकर्ताओं ने कार के अंदर ब्राज़ीलियन साइन लैंग्वेज पहचान के लिए ICSL डेटासेट जारी किया

साझा मोबिलिटी सेवाओं जैसे टैक्सी और राइड-शेयरिंग प्लेटफॉर्म में साइन लैंग्वेज का उपयोग करने की चुनौतियों को दूर करने के लिए इन-कार साइन लैंग्वेज (ICSL) कॉर्पस नामक एक नया मल्टी-मोडल डेटासेट पेश किया गया है। संसाधन सीमित वाहन के अंदर बहरे और कम सुनने वाले समुदाय के लिए सार्वजनिक परिवहन की पहुंच को बेहतर बनाने के लिए ब्राज़ीलियन साइन लैंग्वेज (Libras) पर केंद्रित है।

arxiv arXiv cs.CL · 26 दिन पहले

अध्ययन में जर्मन और अंग्रेजी संयुक्त शब्दों की संरचनात्मकता में समय के साथ एक छोटा नकारात्मक रुझान पाया गया

शोधकर्ताओं ने 23 जर्मन और 26 अंग्रेजी नाम संयुक्त शब्दों में अर्थ परिवर्तन की जांच की, संरचनात्मकता रुझान पूर्वानुमान कार्य को पेश करके, जिसका मूल्यांकन दशक-वार ऐतिहासिक रेटिंग्स के एक नए डेटासेट के खिलाफ किया गया। उस साहित्य के विपरीत जो संयुक्त शब्दों के कम संरचनात्मक होने की निश्चित प्रवृत्ति का समर्थन करता है, अध्ययन में समय के साथ केवल एक छोटा नकारात्मक रुझान पाया गया।

arxiv arXiv cs.CL · 26 दिन पहले

JobHop v2: अनसंरचित अनुभवपत्रों से बड़े पैमाने पर करियर ट्रैजेक्टरी डेटासेट

शोधकर्ताओं ने JobHop v2 जारी किया है, जो कार्यबल योजना और श्रम बाजार विश्लेषण के लिए डिज़ाइन किए गए सार्वजनिक रूप से उपलब्ध JobHop डेटासेट का एक सुधारा हुआ संस्करण है। VDAB, फ्लेमिश पब्लिक एम्प्लॉयमेंट सर्विस द्वारा प्रदान किए गए लगभग 440,000 छद्मनामित बहुभाषी अनुभवपत्रों से अंत-से-अंत बड़े भाषा मॉडल निष्कर्षण के माध्यम से निर्मित, डेटासेट में 355,315 करियर ट्रैजेक्टरी शामिल हैं।

arxiv arXiv cs.LG · 26 दिन पहले

समूह-स्रोत संग्रह से कीवर्ड निकालने के लिए NLP दृष्टिकोणों का मूल्यांकन करने वाला अध्ययन

ऑक्सफोर्ड विश्वविद्यालय के Their Finest Hour Online Archive का उपयोग करने वाले एक परियोजना ने स्केल पर कीवर्ड निकालने को स्वचालित करने के लिए तीन प्राकृतिक भाषा प्रसंस्करण (NLP) दृष्टिकोणों—नाममात्र इकाई पहचान, कीवर्ड निष्कर्षण और विषय मॉडलिंग—का मूल्यांकन किया। अध्ययन ने पारंपरिक सांख्यिकीय मॉडलों से लेकर आधुनिक जनरेटिव AI न्यूरल नेटवर्क तक तकनीकों की एक श्रृंखला में इन विधियों का परीक्षण किया।

arxiv arXiv cs.LG · 27 दिन पहले

अज्ञात संवेगक वर्गीकरण के लिए प्रशिक्षण सेट आकार का अनुमान लगाने हेतु प्रायोगिक सूत्र व्युत्पन्न करने वाला अध्ययन

शोधकर्ताओं ने अज्ञात संवेगक-आधारित वर्गीकरण कार्यों में न्यूनतम नमूना आकार निर्धारित करने के लिए डेटा-संचालित दिशानिर्देशों की कमी को दूर करने के लिए सीखने वक्र अभिसरण दरों का एक व्यवस्थित प्रायोगिक मूल्यांकन प्रस्तुत किया है।