Hugging Face Hub पर सभी 4,893 इंडिक-भाषा डेटासेट के लिए एक मासिक-अपडेट किया गया अनुपालन मैट्रिक्स प्रकाशित किया गया है, जिसमें यह पता चला है कि 1 अगस्त 2026 तक 65.1% ने कोई लाइसेंस टैग घोषित नहीं किया है।
- डेटासेट में से 3,185 में कोई लाइसेंस टैग नहीं है, जो सभी डाउनलोड का 46.1% है।
- 154 डेटासेट CC-BY-NC लाइसेंस का उपयोग करते हैं, जो वाणिज्यिक प्रशिक्षण पाइपलाइन के लिए जोखिम पैदा करते हैं।
- 139 डेटासेट में 'other', 'cc' या 'unknown' जैसे अस्पष्ट टैग हैं।
- पूर्ण डेटा CC0 लाइसेंस के तहत CSV और Parquet प्रारूपों में उपलब्ध है।
मैट्रिक्स टीमों को यूरोपीय संघ AI एक्ट GPAI दस्तावेज़ीकरण कर्तव्यों के तहत वाणिज्यिक उपयोग के लिए प्रभावी रूप से अयोग्य पाए जाने वाले डेटासेट की पहचान करके लाइसेंसिंग जाल से बचने में मदद करता है।