A DeepSeek lançou o DeepSeek-V3, um poderoso modelo de linguagem Mixture-of-Experts (MoE) com 671B parâmetros totais e 37B ativados por token. O modelo utiliza Multi-head Latent Attention e uma estratégia de balanceamento de carga sem perda auxiliar, treinado em 14,8 trilhões de tokens usando precisão mista FP8.

  • DeepSeek-V3 alcança desempenho comparável aos principais modelos fechados, exigindo apenas 2,788M horas de GPU H800 para treinamento completo.
  • O modelo incorpora Multi-Token Prediction (MTP) para aceleração de inferência e destila capacidades de raciocínio da série DeepSeek-R1.
  • Os pesos são fornecidos em formato FP8, com scripts de conversão disponíveis para experimentação em BF16.
  • A implantação local é suportada por frameworks incluindo SGLang, vLLM, LMDeploy e TensorRT-LLM em hardware NVIDIA, AMD e Huawei Ascend.

O lançamento oferece uma alternativa open-source eficiente e de alto desempenho para desenvolvedores, com resultados abrangentes de avaliação que demonstram sua força em tarefas de matemática e código.