O usuário helloadhavan criou um conjunto de dados chamado CC-FilteredCorpus, projetado para filtrar o Common Crawl e extrair conteúdo como Markdown limpo. O projeto visa preservar a estrutura útil do documento, incluindo cabeçalhos, listas, links, blocos de código e tabelas, em vez de achatar tudo em texto puro.

  • O conjunto de dados está hospedado no Hugging Face em helloadhavan/CC-FilteredCorpus.
  • Ele é direcionado ao pré-treinamento de LLM e pesquisa em PLN, onde preservar a estrutura do documento da web é importante.

Este recurso fornece uma alternativa estruturada aos dados brutos do Common Crawl para pesquisadores que precisam de texto formatado.