El usuario helloadhavan ha creado un conjunto de datos llamado CC-FilteredCorpus diseñado para filtrar Common Crawl y extraer contenido como Markdown limpio. El proyecto tiene como objetivo preservar la estructura útil del documento, incluyendo encabezados, listas, enlaces, bloques de código y tablas, en lugar de aplanar todo en texto plano.
- El conjunto de datos está alojado en Hugging Face en helloadhavan/CC-FilteredCorpus.
- Está dirigido al preentrenamiento de LLM e investigación en PLN donde preservar la estructura del documento web es importante.
Este recurso proporciona una alternativa estructurada a los datos sin procesar de Common Crawl para investigadores que necesitan texto formateado.