DeepSeek发布了其新模型DeepSeek V4-1 Flash。这是一个多模态Mixture-of-Experts (MoE)模型,具有5520亿参数的骨干。

  • 该模型支持长达一百万个token的上下文。
  • 它采用具有552B参数的多模态Mixture-of-Experts架构。