DeepSeek已正式发布DeepSeek V4.1 Flash模型,这是其新架构系列中首款原生具备多模态视觉理解能力的最小型号。该模型基于因果编码器-解码器(Causal-Encoder-Decoder)设计,是一个拥有552B参数的混合专家(MoE)模型,在输入端仅激活8B参数,在输出端激活16B参数。

  • 非对称架构显著降低了与已知同规模模型相比的推理成本。
  • KV缓存压缩将HBM需求降至上一代的1/4,SSD需求降至1/8,从而降低了代理类任务的成本。
  • 基准测试显示,V4.1 Flash的智能水平超越了包括DeepSeek V4 Pro在内的旗舰模型。
  • 该模型现已通过名称`deepseek-flash`在DeepSeek API上线,旧的V4 Flash变体将临时路由至此处。
  • 定价已进行调整,区分了高峰和低谷时段费率;2026年9月14日之后,对`deepseek-v4-pro`的请求将路由至V4.1 Flash。

新架构旨在提供更高的能力上限、更快的推理速度、更大的吞吐量以及向更大参数模型扩展的扩展性,同时以更低的成本服务更多用户。