एक इंजीनियर ने सूर्य नर्रेदी के वायरल प्रोजेक्ट की एक प्रतिलिपि को ओपन-सोर्स किया, जो जावास्क्रिप्ट और रीइन्फोर्सेमेंट लर्निंग का उपयोग करके एक कोडिंग मॉडल को वॉटरकलर पेंट करने के लिए प्रशिक्षित करता है। इस कार्यान्वयन में TRL लाइब्रेरी और OpenEnv का उपयोग Hugging Face पर प्रशिक्षण, स्कोरिंग और इनफरेंस के लिए एक एंड-टू-एंड पाइपलाइन बनाने के लिए किया गया है।
- सिस्टम पेंटमेंट ब्लीडिंग और पेपर टेक्सचर जैसे वॉटरकलर प्रभावों को सिमुलेट करने के लिए दस विधियों की एक सीमित सेट का उपयोग करता है।
- रिवार्ड्स दो जजों से प्राप्त होते हैं: सौंदर्य पसंद के लिए HPSv3 और 178 जनरेटेड छवियों के हैंड-रेटेड पूल के खिलाफ आउटपुट की तुलना करने वाला एक पेयरवाइज जज।
- जजों के बीच वजन में भिन्नता के साथ तीन प्रशिक्षण रन किए गए, यह दिखाते हुए कि मॉडल डेटासेट में एन्कोडेड विशिष्ट कलात्मक शैलियों को अनुकरण करना सीख सकता है।
- पूरा रेसिपी, जिसमें RL एन्वायरनमेंट, स्कोरर मॉडल और प्रशिक्षित मॉडल शामिल हैं, Hugging Face Hub पर प्रकाशित किया गया है।
यह प्रोजेक्ट दिखाता है कि कैसे सबजेक्टिव टेस्ट के ऊपर रीइन्फोर्सेमेंट लर्निंग एक छोटे मॉडल को सांख्यिकीय रूप से औसत छवियों के बजाय विशिष्ट कलात्मक शैलियाँ उत्पन्न करने के लिए निर्देशित कर सकता है।