QuantVectors भारत से इंडिक भाषाओं में टिप्पणीयुक्त दस्तावेज़ डेटासेट की तलाश कर रहा है, जिसमें हिंदी, मराठी, गुजराती, बंगाली, पंजाबी, तमिल, उर्दू, तेलुगु, ओड़िया, कन्नड़, मलयालम और असमिया शामिल हैं। डेटासेट में चालान, रसीद, उपयोगिता बिल, भुगतान सलाह, पैकिंग सूची, वाणिज्यिक चालान और क्रेडिट नोट प्रकार शामिल होने चाहिए, प्रत्येक भाषा के लिए लगभग 400 दस्तावेज़, मानव-सत्यापित टिप्पणियाँ, और 99%+ सटीकता। डेटासेट वाणिज्यिक रूप से लाइसेंस योग्य होने चाहिए और ओपन-सोर्स या वाणिज्यिक हो सकते हैं, HuggingFace डेटासेट, शोध डेटासेट, या इस क्षेत्र में विशेषज्ञता वाले विक्रेताओं का अनुरोध किया गया है।
भारत में AI/OCR प्रशिक्षण के लिए इंडिक दस्तावेज़ डेटासेट की खोज
vldmrbesk ने मापित पहचान सटीकता के साथ 51 हज़ार-पन्ने का तsiolkovsky संग्रह जारी किया
कांस्टेंटिन तsiolkovsky की एक पूर्ण व्यक्तिगत आर्काइव, जिसमें 51,008 पन्ने और 2,019 आर्काइव फ़ाइलें शामिल हैं, को CC0 डेटासेट के रूप में जारी किया गया है। यह संग्रह आत्म-शिक्षित रॉकेट सिद्धांतकार के पचास वर्षों के कार्य को कवर करता है और इसमें हस्तलिखित पांडुलिपियों के साथ टाइप कॉपीज़ भी शामिल हैं।
Hugging Face ने The Stack v3 जारी किया, सबसे बड़ा ओपन कोड डेटासेट
Hugging Face ने The Stack v3 जारी किया है, जिसे अब तक का सबसे बड़ा ओपन कोड डेटासेट बताया गया है। रिलीज में विभिन्न उपयोगकर्ताओं की आवश्यकताओं को पूरा करने के लिए दो अलग-अलग एक्सेस तरीके प्रदान किए गए हैं।
IBM ने उच्च-गुणवत्ता वाले कोड के विशाल संश्लेषित डेटासेट CodeAlchemy को ओपन-सोर्स किया
IBM ने CodeAlchemy को ओपन-सोर्स किया, जो एक पाइपलाइन और संश्लेषित डेटासेट है जिसे कोड को एक्जीक्यूशन ट्रेस के साथ जोड़कर AI मॉडल की प्रदर्शन क्षमता को बेहतर बनाने के लिए डिज़ाइन किया गया है। इस रिलीज में 15 प्रोग्रामिंग भाषाओं में लगभग 1 ट्रिलियन टोकन शामिल हैं, जो कुल मिलाकर विकिपीडिया के आकार से कम से कम 200 गुना अधिक है।
MultiSynt/MT ने 36 भाषाओं में 4.8T-टोकन समानांतर कॉर्पस जारी किया
शोधकर्ताओं ने MultiSynt/MT पेश किया, जो एक खुला संश्लेषित समानांतर कॉर्पस है जिसमें 36 यूरोपीय भाषाओं में लगभग 4.8 ट्रिलियन लक्ष्य-भाषा टोकन शामिल हैं। डेटासेट को Tower+ और OPUS-MT/HPLT-MT सिस्टम का उपयोग करके 100 बिलियन उच्च-गुणवत्ता वाले Nemotron-CC टोकन के अनुवाद द्वारा उत्पन्न किया गया है।
Current AI ने 421 इंडेक्स किए गए उत्पादों के साथ Open Source AI Gap Map v0.1 लॉन्च किया
Current AI, एक गैर-लाभकारी संस्था जो फरवरी 2025 में AI Action Summit में स्थापित की गई थी, ने ओपन सोर्स AI की स्थिति को इंडेक्स करने के लिए Open Source AI Gap Map v0.1 लॉन्च किया है।