DeepSeek AI 发布了 DeepSeek-V4.1-Flash,这是一款多模态混合专家模型,具备 100 万 token 的上下文窗口和 FP4 KV 缓存,将全局缓存占用降低至每 token 890 字节。该模型采用因果编码器-解码器架构以及压缩稀疏注意力 2(CSA2),在保持性能的同时显著降低了内存需求。
- 该模型拥有 552B 主干参数、196B Engram 参数,在预填充阶段激活 8B 参数,在解码阶段激活 16B 参数。
- 因果编码器-解码器结构通过从编码器的最终隐藏状态推导解码器的全局 KV,使预填充计算量减半。
- CSA2 将层分配为全量、重索引或复用模式,以跨层共享主 KV 缓存和索引器索引。
- 对主 KV 缓存进行 FP4 量化,使其存储量较 V4 的 FP8 缓存减少近一半。
- 该模型在世界知识和编程方面与 DeepSeek-V4-Pro-Base 持平,同时仅使用其 1/3 的参数总量。
- 它在 Terminal-Bench 2.1 和 DeepSWE v1.1 基准测试中优于 Opus-5 和 GPT-5.6 Sol。
该开源权重模型通过 Hugging Face 以 MIT 许可证提供,支持 vLLM、SGLang 和 Transformers,并提供具有低、高和最大推理层级的公共 API。