Компания DeepSeek-AI представляет DeepSeek-V3, мощную языковую модель Mixture-of-Experts с общим количеством параметров 671B и 37B активных параметров на токен. Модель использует архитектуры Multi-head Latent Attention и DeepSeekMoE для обеспечения эффективного вывода и экономичного обучения.

  • DeepSeek-V3 впервые внедряет стратегию балансировки нагрузки без вспомогательной функции потерь для минимизации снижения производительности.
  • В качестве цели обучения применяется многозадачное предсказание токенов для повышения общей производительности в бенчмарках.
  • Команда впервые подтверждает эффективность смешанной точности FP8 при обучении модели экстремально большого масштаба.
  • Обучение потребовало 14,8 триллионов токенов и обошлось всего в 2,788 млн часов работы GPU H800, что составило примерно 5,576 миллиона долларов.
  • Оценки показывают, что модель превосходит другие модели с открытым исходным кодом и сопоставима по качеству с ведущими закрытыми моделями, такими как GPT-4o и Claude-3.5-Sonnet.

В отчете подчеркивается, что DeepSeek-V3 демонстрирует высокую производительность, сопоставимую с лучшими закрытыми моделями, сохраняя при этомremarkably низкие затраты на обучение и стабильность.