Sebuah matriks kepatuhan yang diperbarui secara bulanan telah diterbitkan untuk semua 4.893 dataset bahasa India di Hugging Face Hub, mengungkapkan bahwa 65,1% tidak mendeklarasikan tag lisensi per 1 Agustus 2026.
- 3.185 dari dataset tersebut tidak memiliki tag lisensi, menyumbang 46,1% dari semua unduhan.
- 154 dataset menggunakan lisensi CC-BY-NC, menimbulkan risiko untuk pipeline pelatihan komersial.
- 139 dataset memiliki tag ambigu seperti 'other', 'cc', atau 'unknown'.
- Data lengkap tersedia dalam format CSV dan Parquet di bawah lisensi CC0.
Matriks ini membantu tim menghindari jebakan lisensi dengan mengidentifikasi dataset yang secara efektif tidak memenuhi syarat untuk penggunaan komersial sesuai dengan kewajiban dokumentasi GPAI UU AI UE.