DeepSeek ha lanzado DeepSeek-R1, un modelo de lenguaje grande entrenado utilizando aprendizaje por refuerzo puro para mejorar sus capacidades de razonamiento sin depender de demostraciones anotadas por humanos.

El modelo exhibe patrones de razonamiento avanzado emergentes, incluyendo auto-reflexión, verificación y adaptación dinámica de estrategias. Logra un rendimiento superior en tareas verificables en matemáticas, competencias de programación y campos STEM en comparación con modelos entrenados mediante aprendizaje supervisado convencional. Además, los patrones de razonamiento desarrollados por este modelo a gran escala pueden utilizarse para guiar y mejorar modelos más pequeños.

Este enfoque demuestra que el aprendizaje por refuerzo por sí solo puede incentificar eficazmente comportamientos de razonamiento complejos en LLM, reduciendo la dependencia de datos extensamente etiquetados por humanos.