DeepSeek는 네이티브 멀티모달 시각적 이해 기능을 갖춘 새로운 아키텍처 시리즈의 가장 작은 구성 요소인 DeepSeek V4.1 Flash 모델을 공식적으로 출시했습니다. Causal-Encoder-Decoder 설계에 기반한 이 모델은 552B 파라미터를 가진 Mixture of Experts (MoE) 모델로, 입력 측에서는 8B 파라미터만 활성화되고 출력 측에서는 16B가 활성화됩니다.

  • 비대칭 아키텍처는 동일한 크기의 기존 모델에 비해 추론 비용을 크게 줄입니다.
  • KV 캐시 압축으로 인해 HBM 요구 사항이 이전 세대의 1/4로, SSD 요구 사항이 1/8로 감소하여 에이전트 스타일 작업의 비용을 낮춥니다.
  • 벤치마크 테스트 결과 V4.1 Flash는 DeepSeek V4 Pro를 포함한 플래그십 모델들의 지능 수준을 능가하는 것으로 나타났습니다.
  • 이 모델은 이제 `deepseek-flash`라는 이름으로 DeepSeek API에서 사용 가능하며, 이전의 V4 Flash 변형 버전들은 일시적으로 해당 모델로 라우팅됩니다.
  • 가격은 피크/오프피크 요금제로 조정되었으며, 2026년 9월 14일 이후 `deepseek-v4-pro`로의 요청은 V4.1 Flash로 라우팅될 예정입니다.

새로운 아키텍처는 더 높은 성능 한계, 빠른 추론, 더 큰 처리량, 그리고 더 많은 사용자를 더 낮은 비용으로 서비스하면서 더 큰 파라미터 수를 가진 모델로의 확장성을 제공하도록 설계되었습니다.