DeepSeek-AI는 총 671B 파라미터와 토큰당 37B가 활성화되는 강력한 Mixture-of-Experts 언어 모델인 DeepSeek-V3를 발표합니다. 이 모델은 효율적인 추론과 비용 효율적인 학습을 달성하기 위해 Multi-head Latent Attention 및 DeepSeekMoE 아키텍처를 채택했습니다.
- DeepSeek-V3는 성능 저하를 최소화하기 위해 부하 균형 잡기에 보조 손실 없는 전략을 선도적으로 도입했습니다.
- 전체 벤치마크 성능을 향상시키기 위해 다중 토큰 예측 학습 목표를 사용합니다.
- 팀은 극대규모 모델에서 FP8 혼합 정밀도 학습을 최초로 검증했습니다.
- 학습에는 14.8조 개의 토큰이 사용되었으며, H800 GPU 시간으로 278만 시간, 총 약 557만 달러의 비용이 들었습니다.
- 평가 결과 다른 오픈소스 모델을 능가하며 GPT-4o 및 Claude-3.5-Sonnet과 같은 주요 폐쇄형 모델과 동등한 성능을 보였습니다.
보고서는 DeepSeek-V3가 매우 낮은 학습 비용과 안정성을 유지하면서 최상위 폐쇄형 모델에 버금가는 강력한 성능을 달성했다고 강조합니다.