DeepSeek已开源DeepSeek-R1,这是一个通过强化学习微调的大型语言模型,旨在增强推理能力。该模型在MATH-500和SWE-bench等基准测试中取得了与OpenAI o1相匹敌的结果。

  • 基于混合专家架构DeepSeek-V3,它使用Group Relative Policy Optimization (GRPO)进行训练。
  • 团队通过在强化学习之前添加带有思维链示例的监督微调来解决RL的“冷启动”问题。
  • 发布了针对Qwen和Llama的蒸馏版本,在数学和编码任务上超越了GPT-4等更大的模型。
  • DeepSeek-R1在发布后不久就在LMArena中总体排名第3,在编码和数学类别中领先。

开源许可证允许使用模型输出进行蒸馏,这可能会推动所有规模语言模型的技术进步。