DeepSeek ha abierto el código fuente de DeepSeek-R1, un modelo de lenguaje grande ajustado mediante aprendizaje por refuerzo para mejorar las capacidades de razonamiento. El modelo obtiene resultados a la par que los de OpenAI o1 en benchmarks como MATH-500 y SWE-bench.

  • Basado en la mezcla de expertos DeepSeek-V3, utiliza Group Relative Policy Optimization (GRPO) para el entrenamiento.
  • El equipo abordó los problemas de "inicio en frío" del RL añadiendo ajuste fino supervisado con ejemplos de cadena de pensamiento antes del aprendizaje por refuerzo.
  • Se lanzaron versiones destiladas para Qwen y Llama, superando a modelos más grandes como GPT-4 en tareas de matemáticas y programación.
  • DeepSeek-R1 se clasificó #3 en general en LMArena poco después de su lanzamiento, liderando en las categorías de programación y matemáticas.

La licencia de código abierto permite utilizar las salidas del modelo para la destilación, lo que podría avanzar el estado del arte para modelos de lenguaje de todos los tamaños.