DeepSeek выпустила DeepSeek-V3, языковую модель Mixture-of-Experts (MoE) с общим количеством 671 миллиард параметров и 37 миллиардами активированных на токен. Модель обучена на 14,8 триллионах токенов и использует Multi-head Latent Attention и стратегию балансировки нагрузки без вспомогательных потерь.
- DeepSeek-V3 демонстрирует производительность, сопоставимую с ведущими закрытыми моделями, при этом для обучения требуется всего 2,788 млн часов работы GPU H800.
- Она включает цель Multi-Token Prediction (MTP) и переносит способности к рассуждению из серии DeepSeek-R1.
- Модель поддерживает вывод через такие библиотеки, как Transformers, vLLM, SGLang и LMDeploy.
Выпуск предоставляет открытый доступ к высокопроизводительной базовой модели с сильными способностями в области математики и кода.