विषय · Training data
media Hugging Face Forums · 2 दिन पहले · 4 बार देखा गया

NewTypeCola ने 66,010 पृष्ठों वाले कोरियाई VOKU Archive डेटासेट को रिलीज़ किया

NewTypeCola ने Hugging Face पर VOKU Archive प्रकाशित किया है, जो दक्षिण कोरिया में छात्र-संचालित कैंपस रेडियो ब्रॉडकास्ट cue sheets की 66,010 स्कैन की गई पृष्ठों का संग्रह है। दस्तावेज़ 1988 से 2019 तक फैले हुए हैं और OCR टेक्स्ट, उपनाम-टोकन एनोटेशन और मेटाडेटा शामिल हैं।

arxiv arXiv cs.AI · 8 दिन पहले · 17 बार देखा गया

VideoX-Qwen निर्देश-आधारित वीडियो संपादन के लिए डेटा-केंद्रित ढांचा पेश करता है

शोधकर्ताओं ने VideoX-Qwen प्रस्तुत किया, एक एकीकृत ढांचा जो स्केलेबल डेटा निर्माण को मॉडल प्रशिक्षण के साथ जोड़ता है ताकि सामान्य-उद्देश्य, निर्देश-चालित वीडियो संपादन को आगे बढ़ाया जा सके। सिस्टम एक उत्पादन पाइपलाइन का उपयोग करता है जो विशेष मॉडलों को दिशात्मक संपादन रिकॉर्ड उत्पन्न करने के लिए संगठित करता है, जिससे जोड़ने, हटाने, प्रतिस्थापित करने और गुण कार्यों में 1.2 मिलियन से अधिक उच्च-गुणवत्ता वाले नमूने प्राप्त होते हैं।

media Hugging Face Forums · 12 दिन पहले · 12 बार देखा गया

हौसा स्वास्थ्य देखभाल LLM प्राथमिकता और सुरक्षा मूल्यांकन डेटासेट

एक कंप्यूटेशनल भाषणविद् और हौसा NLP विशेषज्ञ ने हौसा भाषा में स्वास्थ्य देखभाल और सुरक्षा के संदर्भ में बड़े भाषा मॉडलों का मूल्यांकन करने के लिए डिज़ाइन किए गए एक नए डेटासेट का परिचय दिया है।

media Hugging Face Forums · 12 दिन पहले · 12 बार देखा गया

FlyEscape ने escape-neuron-v1 जारी किया: MaleCNS से प्राप्त 3,376-न्यूरॉन / 78,797-एज कॉम्पैक्ट ग्राफ

FlyEye प्रोजेक्ट ने ब्राउज़र और रनटाइम डेवलपर किट के साथ पहला कॉम्पैक्ट न्यूरॉन-लेवल डेटासेट प्रकाशित किया है। इस रिलीज में Hugging Face पर होस्ट किए गए Tubban/flyeye-escape-neuron-v1 डेटासेट शामिल हैं।

media MarkTechPost · 26 दिन पहले · 32 बार देखा गया

एडैप्शन लैब्स ने 'इनवेंट ए डेटासेट' जारी किया, जो कार्य विवरणों से प्रशिक्षण डेटा उत्पन्न करता है

एडैप्शन लैब्स ने "इनवेंट ए डेटासेट" पेश किया है, एक सुविधा जो बीज कॉरपस, पूर्वनिर्धारित स्कीमा या लेबलिंग गाइड की आवश्यकता के बिना प्राकृतिक भाषा कार्य विवरणों से सीधे संरचित, प्रशिक्षण-तैयार डेटासेट उत्पन्न करती है। यह टूल एडैप्शन ऐप, पायथन एसडीके और रेस्ट एपीआई के माध्यम से उपलब्ध है, जिससे उपयोगकर्ता JSONL, JSON, CSV या Parquet प्रारूपों में उत्पन्न पंक्तियाँ डाउनलोड कर सकते हैं।

arxiv arXiv cs.CL · 29 दिन पहले · 22 बार देखा गया

TrialGPT 2.0 ने बहुकेंद्रीय मूल्यांकन में नैदानिक परीक्षण मिलान की दक्षता और पहुंच को बढ़ाया

लेखकों ने TrialGPT 2.0 प्रस्तुत किया, जो एक AI-सहायित नैदानिक परीक्षण अनुशंसा प्रणाली है जिसे वास्तविक-दुनिया के कार्यान्वयन के लिए डिज़ाइन किया गया है और यह मरीज की आवश्यकताओं और कार्यप्रवाह प्राथमिकताओं के आधार पर यह आकलन करता है कि किन परीक्षणों पर विचार करना उचित होगा।