Foi publicada uma matriz de conformidade atualizada mensalmente para todos os 4.893 conjuntos de dados em idiomas indianos no Hugging Face Hub, revelando que 65,1% não declaram nenhuma tag de licença até 1º de agosto de 2026.

  • 3.185 dos conjuntos de dados não têm tag de licença, correspondendo a 46,1% de todos os downloads.
  • 154 conjuntos de dados usam licenças CC-BY-NC, representando riscos para pipelines de treinamento comercial.
  • 139 conjuntos de dados possuem tags ambíguas como 'other', 'cc' ou 'unknown'.
  • Os dados completos estão disponíveis nos formatos CSV e Parquet sob a licença CC0.

A matriz ajuda as equipes a evitar armadilhas de licenciamento, identificando conjuntos de dados que efetivamente estão desqualificados para uso comercial conforme os deveres de documentação GPAI do Regulamento de IA da UE.