Опубликована ежемесячно обновляемая матрица соответствия для всех 4893 наборов данных на языках Индии на Hugging Face Hub, которая показывает, что по состоянию на 1 августа 2026 года 65,1% не имеют лицензионного тега.

  • У 3185 наборов данных отсутствует лицензионный тег, что составляет 46,1% всех загрузок.
  • 154 набора данных используют лицензии CC-BY-NC, создавая риски для коммерческих конвейеров обучения.
  • 139 наборов данных имеют неоднозначные теги, такие как 'other', 'cc' или 'unknown'.
  • Полные данные доступны в форматах CSV и Parquet под лицензией CC0.

Матрица помогает командам избегать лицензионных ловушек, выявляя наборы данных, которые фактически исключены из коммерческого использования согласно требованиям документации GPAI Закона ЕС об ИИ.