Foi publicada uma matriz de conformidade atualizada mensalmente para todos os 4.893 conjuntos de dados em idiomas indianos no Hugging Face Hub, revelando que 65,1% não declaram nenhuma tag de licença até 1º de agosto de 2026.
- 3.185 dos conjuntos de dados não têm tag de licença, correspondendo a 46,1% de todos os downloads.
- 154 conjuntos de dados usam licenças CC-BY-NC, representando riscos para pipelines de treinamento comercial.
- 139 conjuntos de dados possuem tags ambíguas como 'other', 'cc' ou 'unknown'.
- Os dados completos estão disponíveis nos formatos CSV e Parquet sob a licença CC0.
A matriz ajuda as equipes a evitar armadilhas de licenciamento, identificando conjuntos de dados que efetivamente estão desqualificados para uso comercial conforme os deveres de documentação GPAI do Regulamento de IA da UE.