helloadhavan lança CC-FilteredCorpus para extrair Markdown estruturado do Common Crawl
O usuário helloadhavan criou um conjunto de dados chamado CC-FilteredCorpus, projetado para filtrar o Common Crawl e extrair conteúdo como Markdown limpo. O projeto visa preservar a estrutura útil do documento, incluindo cabeçalhos, listas, links, blocos de código e tabelas, em vez de achatar tudo em texto puro.