DeepSeek는 총 671B 파라미터를 가지며 토큰당 37B가 활성화되는 강력한 Mixture-of-Experts (MoE) 언어 모델인 DeepSeek-V3를 출시했습니다. 이 모델은 Multi-head Latent Attention과 보조 손실 없는 부하 균형 전략을 활용하며, FP8 혼합 정밀도로 14.8조 개의 토큰을 사용하여 훈련되었습니다.

  • DeepSeek-V3는 전체 훈련에 2.788M H800 GPU 시간만 필요하면서도 주요 폐쇄형 모델들과 비교할 만한 성능을 달성합니다.
  • 추론 가속화를 위해 Multi-Token Prediction (MTP)를 통합했으며, DeepSeek-R1 시리즈에서 추론 능력을 증류했습니다.
  • 가중치는 FP8 형식으로 제공되며, BF16 실험을 위한 변환 스크립트가 제공됩니다.
  • NVIDIA, AMD, Huawei Ascend 하드웨어에서 SGLang, vLLM, LMDeploy, TensorRT-LLM 등 프레임워크를 통해 로컬 배포가 지원됩니다.

이 릴리스는 개발자를 위해 효율적이고 고성능인 오픈소스 대안을 제공하며, 수학 및 코드 작업에서의 강점을 보여주는 포괄적인 평가 결과를 포함합니다.