helloadhavan が CC-FilteredCorpus をリリースし、Common Crawl から構造化された Markdown を抽出
ユーザー helloadhavan は、Common Crawl をフィルタリングしてクリーンな Markdown としてコンテンツを抽出するために設計された CC-FilteredCorpus というデータセットを作成しました。このプロジェクトは、すべてをプレーンテキストに平坦化するのではなく、見出し、リスト、リンク、コードブロック、テーブルなど、有用なドキュメント構造を保持することを目指しています。