사용자 helloadhavan은 Common Crawl을 필터링하고 콘텐츠를 깔끔한 Markdown으로 추출하도록 설계된 CC-FilteredCorpus라는 데이터셋을 만들었습니다. 이 프로젝트는 모든 것을 평평한 텍스트로 만드는 대신 제목, 목록, 링크, 코드 블록 및 테이블을 포함한 유용한 문서 구조를 보존하는 것을 목표로 합니다.
- 데이터셋은 Hugging Face의 helloadhavan/CC-FilteredCorpus에 호스팅되어 있습니다.
- 이는 웹 문서 구조를 보존하는 것이 중요한 LLM 사전 훈련 및 NLP 연구를 대상으로 합니다.
이 리소스는 형식화된 텍스트가 필요한 연구원들에게 원시 Common Crawl 데이터의 구조화된 대안을 제공합니다.