Un ingénieur a open-sourcé une reproduction du projet viral de Surya Narreddi, qui entraîne un modèle de codage à peindre des aquarelles en utilisant JavaScript et l'apprentissage par renforcement. L'implémentation utilise la bibliothèque TRL et OpenEnv pour créer un pipeline de bout en bout sur Hugging Face pour l'entraînement, l'évaluation et l'inférence.

  • Le système utilise p5.brush pour simuler des effets d'aquarelle comme le sang du pigment et la texture du papier à travers un ensemble restreint de dix méthodes.
  • Les récompenses sont dérivées de deux juges : HPSv3 pour la préférence esthétique et un juge par paire comparant les sorties à un pool d'images générées notées manuellement de 178 images.
  • Trois exécutions d'entraînement ont été menées avec des poids variables entre les juges, démontrant que le modèle peut apprendre à imiter des styles artistiques spécifiques encodés dans le jeu de données.
  • La recette entière, y compris l'environnement RL, le modèle scoreur et les modèles entraînés, est publiée sur le Hub Hugging Face.

Ce projet démontre comment l'apprentissage par renforcement sur le goût subjectif peut orienter un modèle plus petit pour produire des styles artistiques distincts plutôt que des images statistiquement moyennes.