उपयोगकर्ता helloadhavan ने CC-FilteredCorpus नाम का एक डेटासेट बनाया है, जो Common Crawl को फ़िल्टर करने और सामग्री को साफ़ Markdown के रूप में निकालने के लिए डिज़ाइन किया गया है। परियोजना का उद्देश्य उपयोगी दस्तावेज़ संरचना को बनाए रखना है, जिसमें शीर्षक, सूचियाँ, लिंक, कोड ब्लॉक और तालिकाएं शामिल हैं, न कि सब कुछ को सादे पाठ में बदल देना।

  • डेटासेट Hugging Face पर helloadhavan/CC-FilteredCorpus पर होस्ट किया गया है।
  • यह LLM प्रीट्रेनिंग और NLP शोध के लिए लक्षित है जहाँ वेब दस्तावेज़ संरचना को बनाए रखना महत्वपूर्ण है।

यह संसाधन फ़ॉर्मेट किए गए पाठ की आवश्यकता वाले शोधकर्ताओं के लिए कच्चे Common Crawl डेटा का एक संरचित विकल्प प्रदान करता है।