DeepSeek обновила свою модель DeepSeek-V4-Flash и объявила, что официальный релиз DeepSeek-V4-Pro последует в ближайшее время.
Обновление подтверждено через страницу обновлений документации API компании.
DeepSeek обновила свою модель DeepSeek-V4-Flash и объявила, что официальный релиз DeepSeek-V4-Pro последует в ближайшее время.
Обновление подтверждено через страницу обновлений документации API компании.
Обсуждение на Reddit предполагает, что версия DeepSeek v4 flash для релиза, вероятно, была активирована в API после начальной фазы предварительного просмотра. Сроки совпадают с запланированным открытием весов для середины июля.
Компания DeepSeek выпустила модель DeepSeek-V4-Pro-DSpark на платформе Hugging Face, а также сопроводительную техническую статью.
Компания DeepSeek выпустила модель DeepSeek-V3, мощную языковую модель архитектуры Mixture-of-Experts (MoE), содержащую 671B общих параметров, из которых на каждый токен активируется 37B. Модель использует многозаголовочное латентное внимание (Multi-head Latent Attention) и стратегию балансировки нагрузки без вспомогательной функции потерь; обучение проводилось на 14,8 триллионах токенов с использованием смешанной точности FP8.
Официальный релиз DeepSeek-V4-Flash теперь доступен в API DeepSeek.
LG AI Research выпустила K-EXAONE 2.0, модель с 750B параметров, разработанную в рамках второго этапа проекта суверенной базовой модели ИИ Кореи.
Мы используем cookie для аналитики и улучшения сайта. Вы можете принять или отклонить аналитические cookie. Политика конфиденциальности