DeepSeek发布了DeepSeek-V3,这是一款强大的混合专家(MoE)语言模型,总参数量为671B,每个token激活37B。该模型采用多头潜在注意力机制和无辅助损失负载均衡策略,使用FP8混合精度在14.8万亿个token上进行训练。
- DeepSeek-V3的性能可与领先的闭源模型相媲美,而完整训练仅需2.788M H800 GPU小时。
- 该模型集成了多令牌预测(MTP)以加速推理,并从DeepSeek-R1系列蒸馏出推理能力。
- 权重以FP8格式提供,并提供转换脚本用于BF16实验。
- 支持通过SGLang、vLLM、LMDeploy和TensorRT-LLM等框架在NVIDIA、AMD和华为昇腾硬件上进行本地部署。
此次发布为开发者提供了高效的高性能开源替代方案,全面的评估结果证明了其在数学和代码任务中的强大能力。