用户 helloadhavan 创建了一个名为 CC-FilteredCorpus 的数据集,旨在过滤 Common Crawl 并提取干净的 Markdown 内容。该项目旨在保留有用的文档结构,包括标题、列表、链接、代码块和表格,而不是将所有内容扁平化为纯文本。
- 该数据集托管在 Hugging Face 上,地址为 helloadhavan/CC-FilteredCorpus。
- 它针对 LLM 预训练和 NLP 研究,在这些领域中保留网页文档结构非常重要。
对于需要格式化文本的研究人员来说,这个资源提供了 Common Crawl 原始数据的结构化替代方案。