DeepSeek ha lanzado DeepSeek-V3, un modelo de lenguaje Mixture-of-Experts (MoE) que cuenta con 671 mil millones de parámetros totales y 37 mil millones activados por token. El modelo está entrenado con 14,8 billones de tokens y utiliza Multi-head Latent Attention y una estrategia de balanceo de carga sin pérdida auxiliar.

  • DeepSeek-V3 logra un rendimiento comparable a los modelos propietarios líderes mientras requiere solo 2,788M de horas de GPU H800 para el entrenamiento.
  • Incorpora un objetivo de Predicción Multitoken (MTP) y destila capacidades de razonamiento de la serie DeepSeek-R1.
  • El modelo admite inferencia a través de bibliotecas como Transformers, vLLM, SGLang y LMDeploy.

El lanzamiento proporciona acceso de código abierto a un modelo base de alto rendimiento con fuertes capacidades matemáticas y de código.