ユーザー helloadhavan は、Common Crawl をフィルタリングしてクリーンな Markdown としてコンテンツを抽出するために設計された CC-FilteredCorpus というデータセットを作成しました。このプロジェクトは、すべてをプレーンテキストに平坦化するのではなく、見出し、リスト、リンク、コードブロック、テーブルなど、有用なドキュメント構造を保持することを目指しています。

  • データセットは Hugging Face の helloadhavan/CC-FilteredCorpus にホストされています。
  • これは、ウェブドキュメントの構造を保持することが重要な LLM の事前トレーニングおよび NLP 研究を対象としています。

このリソースは、フォーマットされたテキストを必要とする研究者にとって、生の Common Crawl データの構造化された代替手段を提供します。