Компания DeepSeek официально представила модель DeepSeek V4.1 Flash, самую компактную в новой серии архитектур с нативным мультимодальным визуальным пониманием. Построенная на основе архитектуры Causal-Encoder-Decoder, она представляет собой модель Mixture of Experts (MoE) на 552B параметров, активируя только 8B параметров на стороне ввода и 16B — на стороне вывода.
- Асимметричная архитектура значительно снижает затраты на инференс по сравнению с известными моделями аналогичного размера.
- Сжатие KV-кэша уменьшает требования к HBM до 1/4, а к SSD — до 1/8 от предыдущего поколения, снижая стоимость задач в стиле агентов.
- Тестирование на бенчмарках показывает, что V4.1 Flash превосходит уровень интеллекта флагманских моделей, включая DeepSeek V4 Pro.
- Модель уже доступна через API DeepSeek под именем `deepseek-flash`, а старые версии V4 Flash временно перенаправляются на неё.
- Тарифы были скорректированы с учётом пиковых и непиковых ставок; запросы к `deepseek-v4-pro` будут перенаправляться на V4.1 Flash после 14 сентября 2026 года.
Новая архитектура направлена на обеспечение более высокого предела возможностей, ускоренного инференса, большей пропускной способности и масштабируемости для моделей с большим числом параметров при обслуживании большего числа пользователей при меньшей стоимости.