Hugging Face Hub上のすべての4,893のインド言語データセットを対象とした月次更新版のコンプライアンスマトリックスが公開され、2026年8月1日時点で65.1%がライセンスタグを宣言していないことが明らかになりました。
- 3,185のデータセットにライセンスタグがなく、すべてのダウンロードの46.1%を占めています。
- 154のデータセットがCC-BY-NCライセンスを使用しており、商業用トレーニングパイプラインにリスクをもたらしています。
- 139のデータセットには 'other'、'cc'、または 'unknown' などの曖昧なタグが付いています。
- 完全なデータはCC0ライセンスの下でCSVおよびParquet形式で利用可能です。
このマトリックスは、EU AI Act GPAI文書化義務に基づき商業利用から事実上除外されているデータセットを特定することで、チームがライセンスの罠を回避するのに役立ちます。