DeepSeek a open-sourcé DeepSeek-R1, un grand modèle de langage affiné par apprentissage par renforcement pour améliorer les capacités de raisonnement. Le modèle obtient des résultats équivalents à ceux de l'o1 d'OpenAI sur des benchmarks comme MATH-500 et SWE-bench.
- Basé sur le mélange d'experts DeepSeek-V3, il utilise Group Relative Policy Optimization (GRPO) pour l'entraînement.
- L'équipe a résolu les problèmes de "démarrage à froid" du RL en ajoutant un affinement supervisé avec des exemples de chaîne de pensée avant l'apprentissage par renforcement.
- Des versions distillées pour Qwen et Llama ont été publiées, surpassant des modèles plus grands comme GPT-4 dans les tâches de mathématiques et de codage.
- DeepSeek-R1 s'est classé #3 au global sur LMArena peu après sa sortie, menant dans les catégories de codage et de mathématiques.
La licence open-source permet d'utiliser les sorties du modèle pour la distillation, ce qui pourrait faire avancer l'état de l'art pour les modèles de langage de toutes tailles.