DeepSeek 发布了 DeepSeek-V3-0324,该模型更新相较于其前身 DeepSeek-V3 展现出显著改进,特别是在推理能力、代码可执行性和中文写作熟练度方面。

  • MMLU-Pro 得分从 75.9 提升至 81.2,GPQA 从 59.1 提升至 68.4,AIME 从 39.6 提升至 59.4,LiveCodeBench 从 39.2 提升至 49.2。
  • 增强了前端 Web 开发输出,提高了代码可执行性和美观度。
  • 优化了中文写作风格以与 R1 保持一致,并提升了中长篇内容的质量。
  • 修复了先前 V3 版本中存在的函数调用准确性问题,并增强了多轮交互重写能力。

该更新为使用 Transformers、vLLM 或 SGLang 等库的开发者提供了更好的基准性能和更可靠的函数调用。