Пользователь helloadhavan создал набор данных под названием CC-FilteredCorpus, предназначенный для фильтрации Common Crawl и извлечения контента в виде чистого Markdown. Проект направлен на сохранение полезной структуры документа, включая заголовки, списки, ссылки, блоки кода и таблицы, а не на сведение всего к простому тексту.
- Набор данных размещен на Hugging Face по адресу helloadhavan/CC-FilteredCorpus.
- Он ориентирован на предварительное обучение LLM и исследования в области NLP, где важно сохранять структуру веб-документов.
Этот ресурс предоставляет структурированную альтернативу сырым данным Common Crawl для исследователей, нуждающихся в отформатированном тексте.