DeepSeek发布了DeepSeek-V4.1-Flash,这是一种多模态混合专家(MoE)模型,旨在解决智能体工作负载中长上下文计算和高KV缓存带来的高昂成本。
该模型采用Causal Encoder-Decoder架构,在预填充阶段仅激活8B参数,而解码阶段为16B。通过结合Compressed Sparse Attention 2与FP4缓存技术,其全局KV缓存占用降至每令牌890字节,约为DeepSeek-V4-Flash基线的四分之一。借助SWA Bounded Replay优化,SSD或主机内存上的持久KV缓存使用量减少至上一版本的约八分之一。该模型在包含45T令牌的多模态语料库上进行预训练,并支持长达一百万令牌的上下文。
这些架构改进显著提高了输入密集型工作负载的成本效益,尽管内存占用大幅减小,但性能仍优于基线模型。