已为 Hugging Face Hub 上的所有 4893 个印度语言数据集发布了每月更新的合规矩阵,截至 2026 年 8 月 1 日,其中 65.1% 未声明任何许可证标签。

  • 3185 个数据集没有许可证标签,占所有下载量的 46.1%。
  • 154 个数据集使用 CC-BY-NC 许可证,对商业训练管道构成风险。
  • 139 个数据集带有模糊标签,如 'other'、'cc' 或 'unknown'。
  • 完整数据以 CSV 和 Parquet 格式提供,采用 CC0 许可证。

该矩阵通过识别根据欧盟 AI 法案 GPAI 文档义务实际上被排除在商业使用之外的数据集,帮助团队避免许可陷阱。