Um engenheiro abriu o código-fonte de uma reprodução do projeto viral de Surya Narreddi, que treina um modelo de codificação para pintar aquarelas usando JavaScript e aprendizado por reforço. A implementação utiliza a biblioteca TRL e OpenEnv para criar um pipeline de ponta a ponta no Hugging Face para treinamento, pontuação e inferência.

  • O sistema usa p5.brush para simular efeitos de aquarela como sangramento de pigmento e textura do papel por meio de um conjunto restrito de dez métodos.
  • As recompensas são derivadas de dois juízes: HPSv3 para preferência estética e um juiz pareado que compara as saídas contra um conjunto manual de 178 imagens geradas.
  • Três execuções de treinamento foram realizadas com pesos variados entre os juízes, demonstrando que o modelo pode aprender a imitar estilos artísticos específicos codificados no conjunto de dados.
  • A receita completa, incluindo o ambiente RL, o modelo de pontuação e os modelos treinados, está publicada no Hugging Face Hub.

Este projeto demonstra como o aprendizado por reforço sobre gosto subjetivo pode orientar um modelo menor a produzir estilos artísticos distintos em vez de imagens estatisticamente médias.