A DeepSeek-AI apresenta o DeepSeek-V3, um poderoso modelo de linguagem Mixture-of-Experts com 671B de parâmetros totais e 37B ativados por token. O modelo adota as arquiteturas Multi-head Latent Attention e DeepSeekMoE para alcançar inferência eficiente e treinamento economicamente viável.
- O DeepSeek-V3 inaugura uma estratégia sem perda auxiliar para balanceamento de carga, visando minimizar a degradação do desempenho.
- Ele emprega um objetivo de treinamento de previsão multi-token para melhorar o desempenho geral nos benchmarks.
- A equipe valida pela primeira vez o treinamento de precisão mista FP8 em um modelo de escala extremamente grande.
- O treinamento utilizou 14,8 trilhões de tokens e custou apenas 2,788M horas de GPU H800, totalizando aproximadamente US$ 5,576 milhões.
- As avaliações mostram que ele supera outros modelos de código aberto e iguala os principais modelos fechados, como GPT-4o e Claude-3.5-Sonnet.
O relatório enfatiza que o DeepSeek-V3 alcança um desempenho forte comparável aos modelos fechados de ponta, mantendo custos de treinamento e estabilidade notavelmente baixos.