DeepSeek는 총 6710억 개의 파라미터와 토큰당 370억 개가 활성화되는 Mixture-of-Experts (MoE) 언어 모델인 DeepSeek-V3를 출시했습니다. 이 모델은 14.8조 개의 토큰으로 학습되었으며, Multi-head Latent Attention과 보조 손실 없는 부하 균형 전략을 사용합니다.

  • DeepSeek-V3는 주요 폐쇄형 소스 모델과 비교할 만한 성능을 달성하면서 학습에는 278.8만 시간의 H800 GPU 시간만 필요합니다.
  • Multi-Token Prediction (MTP) 목적을 포함하며, DeepSeek-R1 시리즈에서 추론 능력을 증류합니다.
  • 이 모델은 Transformers, vLLM, SGLang, LMDeploy와 같은 라이브러리를 통해 추론을 지원합니다.

이번 출시로 강력한 수학 및 코드 능력을 갖춘 고성능 기본 모델에 대한 오픈소스 접근이 제공됩니다.