DeepSeek ha lanzado DeepSeek-V3, un potente modelo de lenguaje Mixture-of-Experts (MoE) que cuenta con 671B parámetros totales y 37B activados por token. El modelo utiliza Atención Latente Multi-cabeza y una estrategia de equilibrio de carga sin pérdida auxiliar, entrenado en 14.8 billones de tokens usando precisión mixta FP8.

  • DeepSeek-V3 logra un rendimiento comparable al de los principales modelos propietarios cerrados, mientras requiere solo 2.788M horas de GPU H800 para el entrenamiento completo.
  • El modelo incorpora Predicción Multi-Tokens (MTP) para acelerar la inferencia y destila capacidades de razonamiento de la serie DeepSeek-R1.
  • Los pesos se proporcionan en formato FP8, con scripts de conversión disponibles para experimentación en BF16.
  • Se admite el despliegue local a través de frameworks como SGLang, vLLM, LMDeploy y TensorRT-LLM en hardware NVIDIA, AMD y Huawei Ascend.

El lanzamiento ofrece una alternativa eficiente y de alto rendimiento de código abierto para desarrolladores, con resultados de evaluación exhaustivos que demuestran su fortaleza en tareas matemáticas y de código.