DeepSeek-AI 推出了 DeepSeek-V3,这是一款强大的混合专家(Mixture-of-Experts)语言模型,总参数量为 671B,每个 token 激活 37B。该模型采用多头潜在注意力(Multi-head Latent Attention)和 DeepSeekMoE 架构,以实现高效的推理和高性价比的训练。
- DeepSeek-V3 首创了无辅助损失的负载平衡策略,以最小化性能下降。
- 它采用多 token 预测训练目标,以提升整体基准测试性能。
- 团队首次在超大规模模型上验证了 FP8 混合精度训练。
- 训练使用了 14.8 万亿个 token,仅消耗 278.8 万小时 H800 GPU 时间,总成本约为 557.6 万美元。
- 评估结果显示,其性能优于其他开源模型,并与 GPT-4o 和 Claude-3.5-Sonnet 等领先的闭源模型相当。
报告强调,DeepSeek-V3 在保持极低训练成本和稳定性的同时,实现了与顶级闭源模型相媲美的强大性能。