DeepSeek发布了DeepSeek-V3,这是一个混合专家(MoE)语言模型,总参数量为6710亿,每个token激活370亿。该模型在14.8万亿个token上进行了训练,并使用了多头潜在注意力(Multi-head Latent Attention)和无辅助损失负载均衡策略。
- DeepSeek-V3的性能可与领先的闭源模型相媲美,而训练仅需278.8万小时H800 GPU时间。
- 它采用了多令牌预测(MTP)目标,并从DeepSeek-R1系列中蒸馏推理能力。
- 该模型支持通过Transformers、vLLM、SGLang和LMDeploy等库进行推理。
此次发布提供了对具有强大数学和代码能力的高性能基础模型的开源访问。