Pengguna helloadhavan telah membuat kumpulan data bernama CC-FilteredCorpus yang dirancang untuk memfilter Common Crawl dan mengekstrak konten sebagai Markdown bersih. Proyek ini bertujuan untuk melestarikan struktur dokumen yang berguna, termasuk judul, daftar, tautan, blok kode, dan tabel, alih-alih meratakan semuanya menjadi teks biasa.

  • Kumpulan data ini di-hosting di Hugging Face di helloadhavan/CC-FilteredCorpus.
  • Ini menargetkan pra-pelatihan LLM dan penelitian NLP di mana melestarikan struktur dokumen web sangat penting.

Sumber daya ini menyediakan alternatif terstruktur untuk data mentah Common Crawl bagi peneliti yang membutuhkan teks terformat.