A DeepSeek lançou o DeepSeek-V3, um modelo de linguagem Mixture-of-Experts (MoE) com 671 bilhões de parâmetros totais e 37 bilhões ativados por token. O modelo é treinado em 14,8 trilhões de tokens e utiliza Multi-head Latent Attention e uma estratégia de balanceamento de carga sem perda auxiliar.
- DeepSeek-V3 alcança desempenho comparável aos principais modelos proprietários, exigindo apenas 2,788M de horas de GPU H800 para treinamento.
- Ele incorpora um objetivo de Predição Multitoken (MTP) e destila capacidades de raciocínio da série DeepSeek-R1.
- O modelo suporta inferência por meio de bibliotecas como Transformers, vLLM, SGLang e LMDeploy.
O lançamento fornece acesso de código aberto a um modelo base de alto desempenho com fortes capacidades matemáticas e de código.