Un ingeniero ha liberado como código abierto una reproducción del proyecto viral de Surya Narreddi, que entrena un modelo de programación para pintar acuarelas utilizando JavaScript y aprendizaje por refuerzo. La implementación utiliza la biblioteca TRL y OpenEnv para crear un pipeline de extremo a extremo en Hugging Face para entrenamiento, puntuación e inferencia.

  • El sistema utiliza p5.brush para simular efectos de acuarela como el sangrado del pigmento y la textura del papel mediante un conjunto restringido de diez métodos.
  • Las recompensas se derivan de dos jueces: HPSv3 para la preferencia estética y un juez por pares que compara las salidas contra un conjunto de 178 imágenes generadas valoradas manualmente.
  • Se realizaron tres ejecuciones de entrenamiento con pesos variables entre los jueces, demostrando que el modelo puede aprender a imitar estilos artísticos específicos codificados en el conjunto de datos.
  • Toda la receta, incluido el entorno de RL, el modelo de puntuación y los modelos entrenados, está publicada en el Hugging Face Hub.

Este proyecto demuestra cómo el aprendizaje por refuerzo sobre el gusto subjetivo puede orientar a un modelo más pequeño para producir estilos artísticos distintos en lugar de imágenes estadísticamente promedio.