DeepSeek ha lanzado DeepSeek-V3, un potente modelo de lenguaje Mixture-of-Experts (MoE) que cuenta con 671B parámetros totales y 37B activados por token. El modelo utiliza Atención Latente Multi-cabeza y una estrategia de equilibrio de carga sin pérdida auxiliar, entrenado en 14.8 billones de tokens usando precisión mixta FP8.
- DeepSeek-V3 logra un rendimiento comparable al de los principales modelos propietarios cerrados, mientras requiere solo 2.788M horas de GPU H800 para el entrenamiento completo.
- El modelo incorpora Predicción Multi-Tokens (MTP) para acelerar la inferencia y destila capacidades de razonamiento de la serie DeepSeek-R1.
- Los pesos se proporcionan en formato FP8, con scripts de conversión disponibles para experimentación en BF16.
- Se admite el despliegue local a través de frameworks como SGLang, vLLM, LMDeploy y TensorRT-LLM en hardware NVIDIA, AMD y Huawei Ascend.
El lanzamiento ofrece una alternativa eficiente y de alto rendimiento de código abierto para desarrolladores, con resultados de evaluación exhaustivos que demuestran su fortaleza en tareas matemáticas y de código.