Компания DeepSeek выпустила модель DeepSeek-V3, мощную языковую модель архитектуры Mixture-of-Experts (MoE), содержащую 671B общих параметров, из которых на каждый токен активируется 37B. Модель использует многозаголовочное латентное внимание (Multi-head Latent Attention) и стратегию балансировки нагрузки без вспомогательной функции потерь; обучение проводилось на 14,8 триллионах токенов с использованием смешанной точности FP8.

  • DeepSeek-V3 демонстрирует производительность, сопоставимую с ведущими закрытыми моделями, при этом для полного обучения требуется всего 2,788 млн часов работы GPU H800.
  • Модель включает механизм Multi-Token Prediction (MTP) для ускорения вывода и переносит способности к рассуждению из серии DeepSeek-R1.
  • Веса предоставляются в формате FP8; доступны скрипты конвертации для экспериментов с BF16.
  • Локальное развёртывание поддерживается через фреймворки SGLang, vLLM, LMDeploy и TensorRT-LLM на аппаратных платформах NVIDIA, AMD и Huawei Ascend.

Выпуск представляет собой эффективную высокопроизводительную альтернативу с открытым исходным кодом для разработчиков; всесторонние результаты оценки подтверждают её сильные стороны в задачах математики и программирования.