DeepSeek ha abierto el código fuente de DeepSeek-R1, un modelo de lenguaje grande ajustado mediante aprendizaje por refuerzo para mejorar las capacidades de razonamiento. El modelo obtiene resultados a la par que los de OpenAI o1 en benchmarks como MATH-500 y SWE-bench.
- Basado en la mezcla de expertos DeepSeek-V3, utiliza Group Relative Policy Optimization (GRPO) para el entrenamiento.
- El equipo abordó los problemas de "inicio en frío" del RL añadiendo ajuste fino supervisado con ejemplos de cadena de pensamiento antes del aprendizaje por refuerzo.
- Se lanzaron versiones destiladas para Qwen y Llama, superando a modelos más grandes como GPT-4 en tareas de matemáticas y programación.
- DeepSeek-R1 se clasificó #3 en general en LMArena poco después de su lanzamiento, liderando en las categorías de programación y matemáticas.
La licencia de código abierto permite utilizar las salidas del modelo para la destilación, lo que podría avanzar el estado del arte para modelos de lenguaje de todos los tamaños.