L'utilisateur helloadhavan a créé un ensemble de données appelé CC-FilteredCorpus conçu pour filtrer Common Crawl et extraire du contenu sous forme de Markdown propre. Le projet vise à préserver la structure utile du document, y compris les en-têtes, les listes, les liens, les blocs de code et les tableaux, plutôt que de tout aplatir en texte brut.

  • L'ensemble de données est hébergé sur Hugging Face à l'adresse helloadhavan/CC-FilteredCorpus.
  • Il cible le pré-entraînement des LLM et la recherche en NLP où la préservation de la structure du document web est importante.

Cette ressource fournit une alternative structurée aux données brutes de Common Crawl pour les chercheurs ayant besoin de texte formaté.