El usuario helloadhavan ha creado un conjunto de datos llamado CC-FilteredCorpus diseñado para filtrar Common Crawl y extraer contenido como Markdown limpio. El proyecto tiene como objetivo preservar la estructura útil del documento, incluyendo encabezados, listas, enlaces, bloques de código y tablas, en lugar de aplanar todo en texto plano.

  • El conjunto de datos está alojado en Hugging Face en helloadhavan/CC-FilteredCorpus.
  • Está dirigido al preentrenamiento de LLM e investigación en PLN donde preservar la estructura del documento web es importante.

Este recurso proporciona una alternativa estructurada a los datos sin procesar de Common Crawl para investigadores que necesitan texto formateado.