Un ingeniero ha liberado como código abierto una reproducción del proyecto viral de Surya Narreddi, que entrena un modelo de programación para pintar acuarelas utilizando JavaScript y aprendizaje por refuerzo. La implementación utiliza la biblioteca TRL y OpenEnv para crear un pipeline de extremo a extremo en Hugging Face para entrenamiento, puntuación e inferencia.
- El sistema utiliza p5.brush para simular efectos de acuarela como el sangrado del pigmento y la textura del papel mediante un conjunto restringido de diez métodos.
- Las recompensas se derivan de dos jueces: HPSv3 para la preferencia estética y un juez por pares que compara las salidas contra un conjunto de 178 imágenes generadas valoradas manualmente.
- Se realizaron tres ejecuciones de entrenamiento con pesos variables entre los jueces, demostrando que el modelo puede aprender a imitar estilos artísticos específicos codificados en el conjunto de datos.
- Toda la receta, incluido el entorno de RL, el modelo de puntuación y los modelos entrenados, está publicada en el Hugging Face Hub.
Este proyecto demuestra cómo el aprendizaje por refuerzo sobre el gusto subjetivo puede orientar a un modelo más pequeño para producir estilos artísticos distintos en lugar de imágenes estadísticamente promedio.