DeepSeek-AI presenta DeepSeek-V3, un potente modelo de lenguaje Mixture-of-Experts con 671B parámetros totales y 37B activados por token. El modelo adopta las arquitecturas Multi-head Latent Attention y DeepSeekMoE para lograr inferencia eficiente y entrenamiento rentable.

  • DeepSeek-V3 introduce una estrategia sin pérdida auxiliar para el equilibrio de carga con el fin de minimizar la degradación del rendimiento.
  • Emplea un objetivo de entrenamiento de predicción multi-token para mejorar el rendimiento general en benchmarks.
  • El equipo valida por primera vez el entrenamiento de precisión mixta FP8 en un modelo a escala extremadamente grande.
  • El entrenamiento utilizó 14.8 billones de tokens y costó solo 2.788M horas de GPU H800, totalizando aproximadamente $5.576 millones.
  • Las evaluaciones muestran que supera a otros modelos de código abierto e iguala a los principales modelos cerrados como GPT-4o y Claude-3.5-Sonnet.

El informe enfatiza que DeepSeek-V3 logra un rendimiento fuerte comparable al de los modelos cerrados de primer nivel mientras mantiene costos de entrenamiento y estabilidad notablemente bajos.