Training data
arxiv arXiv cs.AI · 5 घंटे पहले · 10 बार देखा गया

VideoX-Qwen निर्देश-आधारित वीडियो संपादन के लिए डेटा-केंद्रित ढांचा पेश करता है

शोधकर्ताओं ने VideoX-Qwen प्रस्तुत किया, एक एकीकृत ढांचा जो स्केलेबल डेटा निर्माण को मॉडल प्रशिक्षण के साथ जोड़ता है ताकि सामान्य-उद्देश्य, निर्देश-चालित वीडियो संपादन को आगे बढ़ाया जा सके। सिस्टम एक उत्पादन पाइपलाइन का उपयोग करता है जो विशेष मॉडलों को दिशात्मक संपादन रिकॉर्ड उत्पन्न करने के लिए संगठित करता है, जिससे जोड़ने, हटाने, प्रतिस्थापित करने और गुण कार्यों में 1.2 मिलियन से अधिक उच्च-गुणवत्ता वाले नमूने प्राप्त होते हैं।

media Hugging Face Forums · 5 दिन पहले · 10 बार देखा गया

हौसा स्वास्थ्य देखभाल LLM प्राथमिकता और सुरक्षा मूल्यांकन डेटासेट

एक कंप्यूटेशनल भाषणविद् और हौसा NLP विशेषज्ञ ने हौसा भाषा में स्वास्थ्य देखभाल और सुरक्षा के संदर्भ में बड़े भाषा मॉडलों का मूल्यांकन करने के लिए डिज़ाइन किए गए एक नए डेटासेट का परिचय दिया है।

media Hugging Face Forums · 5 दिन पहले · 11 बार देखा गया

FlyEscape ने escape-neuron-v1 जारी किया: MaleCNS से प्राप्त 3,376-न्यूरॉन / 78,797-एज कॉम्पैक्ट ग्राफ

FlyEye प्रोजेक्ट ने ब्राउज़र और रनटाइम डेवलपर किट के साथ पहला कॉम्पैक्ट न्यूरॉन-लेवल डेटासेट प्रकाशित किया है। इस रिलीज में Hugging Face पर होस्ट किए गए Tubban/flyeye-escape-neuron-v1 डेटासेट शामिल हैं।

media MarkTechPost · 18 दिन पहले · 27 बार देखा गया

एडैप्शन लैब्स ने 'इनवेंट ए डेटासेट' जारी किया, जो कार्य विवरणों से प्रशिक्षण डेटा उत्पन्न करता है

एडैप्शन लैब्स ने "इनवेंट ए डेटासेट" पेश किया है, एक सुविधा जो बीज कॉरपस, पूर्वनिर्धारित स्कीमा या लेबलिंग गाइड की आवश्यकता के बिना प्राकृतिक भाषा कार्य विवरणों से सीधे संरचित, प्रशिक्षण-तैयार डेटासेट उत्पन्न करती है। यह टूल एडैप्शन ऐप, पायथन एसडीके और रेस्ट एपीआई के माध्यम से उपलब्ध है, जिससे उपयोगकर्ता JSONL, JSON, CSV या Parquet प्रारूपों में उत्पन्न पंक्तियाँ डाउनलोड कर सकते हैं।

arxiv arXiv cs.CL · 21 दिन पहले · 17 बार देखा गया

TrialGPT 2.0 ने बहुकेंद्रीय मूल्यांकन में नैदानिक परीक्षण मिलान की दक्षता और पहुंच को बढ़ाया

लेखकों ने TrialGPT 2.0 प्रस्तुत किया, जो एक AI-सहायित नैदानिक परीक्षण अनुशंसा प्रणाली है जिसे वास्तविक-दुनिया के कार्यान्वयन के लिए डिज़ाइन किया गया है और यह मरीज की आवश्यकताओं और कार्यप्रवाह प्राथमिकताओं के आधार पर यह आकलन करता है कि किन परीक्षणों पर विचार करना उचित होगा।

media Hugging Face Forums · 23 दिन पहले · 29 बार देखा गया

ट्यूटोरियल: शून्य से एक बाइट-लेवल BPE टोकनाइज़र बनाएं और प्रशिक्षित करें

एक नया ट्यूटोरियल पहले सिद्धांतों से बाइट-लेवल BPE टोकनाइज़र बनाने और प्रशिक्षित करने की चरण-दर-चरण प्रक्रिया को दस्तावेज़ीकृत करता है। गाइड में यूनिकोड-अवेयर प्री-टोकनाइजेशन, क्रमिक पेयर-फ्रीक्वेंसी अपडेट और लेजी डिलीशन के साथ मैक्स हीप का उपयोग जैसे महत्वपूर्ण कार्यान्वयन विवरण शामिल हैं।

lab Hugging Face Blog · 25 दिन पहले · 36 बार देखा गया

ओपन एएसआर लीडरबोर्ड में हिंदी और भारतीय अंग्रेजी के लिए मॉन्सून डेटासेट जोड़े गए

ओपन एएसआर लीडरबोर्ड ने दो नए मूल्यांकन सेट: मॉन्सून en-IN (भारतीय अंग्रेजी) और मॉन्सून hi-IN (हिंदी) के साथ अपने पहले ग्लोबल साउथ भाषाओं को पेश किया है। ये जोड़ मौजूदा बेंचमार्क्स में जनसांख्यिकीय विविधता की कमी को दूर करते हैं, जिन्होंने ऐतिहासिक रूप से यूरोपीय भाषाओं पर ध्यान केंद्रित किया है।

media Hugging Face Forums · 26 दिन पहले · 25 बार देखा गया

omertt27 ने रोबोटिक्स डेटासेट के लिए Calibra जारी किया, जो डेटासेट अवलोकन और कोरसेट चयन के लिए है

लेखक ने Calibra जारी किया है, एक उपकरण जो GPU संसाधनों को खपत करने से पहले रोबोटिक्स इमिटेशन लर्निंग डेटासेट में खराब प्रदर्शनों की पहचान करने के लिए डिज़ाइन किया गया है।

media Hugging Face Forums · 28 दिन पहले · 40 बार देखा गया

Harmonic Frontier ने Celtic Constellation Reference Sessions डेटासेट का प्रीव्यू जारी किया

Harmonic Frontier ने पारंपरिक और समकालीन सेल्टिक एन्सेम्बल व्यवस्थाओं के संरेखित मल्टीट्रैक रिकॉर्डिंग्स को शामिल करते हुए Celtic Constellation Reference Sessions डेटासेट का एक प्रीव्यू प्रकाशित किया है। आर्किटेक्चर में संरेखित जोड़े शामिल हैं जहाँ प्रत्येक टुकड़े में सूखे अलग किए गए स्टेम्स, एक ही प्रदर्शन को उत्पादन चेन से गुजारने के बाद और तैयार मिक्स शामिल हैं।

media Hugging Face Forums · 29 दिन पहले · 39 बार देखा गया

vldmrbesk ने मापित पहचान सटीकता के साथ 51 हज़ार-पन्ने का तsiolkovsky संग्रह जारी किया

कांस्टेंटिन तsiolkovsky की एक पूर्ण व्यक्तिगत आर्काइव, जिसमें 51,008 पन्ने और 2,019 आर्काइव फ़ाइलें शामिल हैं, को CC0 डेटासेट के रूप में जारी किया गया है। यह संग्रह आत्म-शिक्षित रॉकेट सिद्धांतकार के पचास वर्षों के कार्य को कवर करता है और इसमें हस्तलिखित पांडुलिपियों के साथ टाइप कॉपीज़ भी शामिल हैं।