한 엔지니어가 JavaScript와 강화학습을 활용해 수채화를 그리는 코딩 모델을 훈련하는 Surya Narreddi의 바이럴 프로젝트를 복제해 오픈소스로 공개했다. 이 구현은 TRL 라이브러리와 OpenEnv를 활용하여 Hugging Face 위에서 훈련, 평가, 추론을 위한 엔드투엔드 파이프라인을 구축한다.

  • 시스템은 제한된 10가지 메서드를 통해 안료 번짐과 종이 질감 같은 수채화 효과를 시뮬레이션하기 위해 p5.brush를 사용한다.
  • 보상은 미적 선호도를 평가하는 HPSv3와 손으로 등급을 매긴 178장의 생성 이미지 풀과 출력을 비교하는 쌍별 판정자라는 두 명의 판정자로부터 도출된다.
  • 판정자들 간의 가중치를 다르게 한 세 번의 훈련 실행이 진행되었으며, 이를 통해 모델이 데이터셋에 인코딩된 특정 예술 스타일을 모방하는 방법을 학습할 수 있음이 입증되었다.

RL 환경, 스코어 모델, 훈련된 모델을 포함한 전체 레시피는 Hugging Face Hub에 공개되어 있다.

이 프로젝트는 주관적인 취향에 대한 강화학습이 더 작은 모델을 통계적으로 평균적인 이미지가 아닌 독특한 예술 스타일을 생성하도록 이끄는 방법을 보여준다.