DeepSeek выпустила DeepSeek-V4.1-Flash, мультимодальную модель Mixture-of-Experts, предназначенную для решения проблемы высоких вычислительных затрат и больших KV-кэшей при работе агентов.
Модель использует архитектуру Causal Encoder-Decoder, которая активирует только 8B параметров на этапе префиллинга по сравнению с 16B на этапе декодирования. Она достигает глобального размера KV-кэша в 890 байт на токен за счет комбинации Compressed Sparse Attention 2 и FP4 кэширования, что составляет примерно одну четверть от базовой версии DeepSeek-V4-Flash. Использование постоянного KV-кэша на SSD или в памяти хоста сокращено примерно до одной восьмой части предыдущей версии благодаря оптимизации SWA Bounded Replay. Модель обучалась на мультимодальном корпусе из 45T токенов и поддерживает контексты длиной до одного миллиона токенов.
Эти архитектурные изменения существенно повышают экономическую эффективность для рабочих нагрузок, требующих большого объема ввода, обеспечивая при этом лучшую производительность по сравнению с базовой версией, несмотря на значительно меньший объем потребляемой памяти.