연구자들은 PLVR(Program Learning with Verifiable Rewards)을 소개했습니다. 이는 모델 가중치를 업데이트하는 대신 결정론적 및 신경 원시 요소로 구성된 명시적 추론 프로그램을 학습하는 사후 훈련 방법입니다. 이 접근 방식은 기호적 역전파를 사용하며, 여기서 신용 할당은 추정 대신 원시 요소 서명에 대한 타입 추론을 통해 수행됩니다.
- LiveCodeBench v6 및 Tau2Bench에서 PLVR이 적용된 30B 베이스 모델은 동일한 예산 하에서 강화 학습보다 평균 27.8점 더 우수합니다.
- 이 방법은 또한 규모가 한 차수 더 큰 프론티어 모델보다 13.6점 더 우수합니다.
- 단일 원시 요소 라이브러리가 두 벤치마크 모두에 사용되며, 새로운 작업에는 추가 파인튜닝 데이터 없이 100개의 예제만 필요합니다.
- 실험은 균일 샘플링에 대한 우위의 원인이 역전파 과정임을 확인했습니다.
저자들은 다른 원시 요소 라이브러리에 적용할 수 있도록 기호적 역전파 라이브러리와 준수 검사기를 출시했습니다.