DeepSeek는 인간의 주석이 달린 데모스트레이션을 의존하지 않고 추론 능력을 향상시키기 위해 순수한 강화 학습으로 훈련된 대규모 언어 모델인 DeepSeek-R1을 출시했습니다.
이 모델은 자기 성찰, 검증 및 동적 전략 적응을 포함하는 출현한 고급 추론 패턴을 보여줍니다. 수학, 코딩 대회 및 STEM 분야의 검증 가능한 작업에서 전통적인 지도 학습으로 훈련된 모델보다 우수한 성능을 달성합니다. 또한 이 대규모 모델이 개발한 추론 패턴은 더 작은 모델을 안내하고 개선하는 데 사용할 수 있습니다.
이 접근 방식은 강화 학습만으로 LLM 내에서 복잡한 추론 행동을 효과적으로 장려할 수 있으며 광범위한 인간 레이블 데이터에 대한 의존성을 줄인다는 것을 보여줍니다.