Se ha publicado una matriz de cumplimiento actualizada mensualmente para los 4.893 conjuntos de datos en idiomas indios en el Hub de Hugging Face, revelando que el 65,1% no declara ninguna etiqueta de licencia al 1 de agosto de 2026.
- 3.185 de los conjuntos de datos no tienen etiqueta de licencia, lo que representa el 46,1% de todas las descargas.
- 154 conjuntos de datos utilizan licencias CC-BY-NC, planteando riesgos para los pipelines de entrenamiento comercial.
- 139 conjuntos de datos tienen etiquetas ambiguas como 'other', 'cc' o 'unknown'.
- Los datos completos están disponibles en formatos CSV y Parquet bajo la licencia CC0.
La matriz ayuda a los equipos a evitar trampas de licencias identificando conjuntos de datos que efectivamente están descalificados para el uso comercial según las obligaciones de documentación GPAI del Reglamento de IA de la UE.