DeepSeek a publié DeepSeek-R1, un grand modèle de langage entraîné en utilisant uniquement l'apprentissage par renforcement pour améliorer ses capacités de raisonnement sans s'appuyer sur des démonstrations annotées par des humains.
Le modèle présente des motifs de raisonnement avancés émergents, y compris l'auto-réflexion, la vérification et l'adaptation dynamique des stratégies. Il obtient des performances supérieures sur des tâches vérifiables en mathématiques, compétitions de codage et domaines STEM par rapport aux modèles entraînés par apprentissage supervisé conventionnel. De plus, les motifs de raisonnement développés par ce modèle à grande échelle peuvent être utilisés pour guider et améliorer des modèles plus petits.
Cette approche démontre que l'apprentissage par renforcement seul peut efficacement inciter des comportements de raisonnement complexes dans les LLM, réduisant la dépendance aux données massivement étiquetées par des humains.