DeepSeek AI는 100만 토큰의 컨텍스트 윈도우와 글로벌 캐시 크기를 토큰당 890바이트로 줄이는 FP4 KV 캐시를 탑재한 멀티모달 Mixture-of-Experts 모델인 DeepSeek-V4.1-Flash를 출시했습니다. 이 모델은 성능을 유지하면서 메모리 요구사항을 크게 낮추기 위해 인코더-디코더 구조와 Compressed Sparse Attention 2(CSA2)를 활용합니다.
- 모델은 552B의 백본 파라미터, 196B의 Engram 파라미터를 가지며, prefill 시 8B, decode 시 16B의 파라미터가 활성화됩니다.
- 인코더의 최종 은닉 상태로부터 디코더의 글로벌 KV를 유도하여 prefill 연산을 절반으로 줄이는 인코더-디코더 구조를 채택했습니다.
- CSA2는 레이어를 Full, Reindex, 또는 Reuse 모드로 할당하여 메인 KV 캐시와 인덱서 인덱스를 레이어 간에 공유합니다.
- 메인 KV 캐시에 대한 FP4 양자화는 V4의 FP8 캐시 대비 저장 공간을 거의 절반으로 줄입니다.
- 모델은 전 세계 지식과 코딩 분야에서 DeepSeek-V4-Pro-Base와 동등한 성능을 보이며, 전체 파라미터의 1/3만 사용합니다.
- Terminal-Bench 2.1 및 DeepSWE v1.1 벤치마크에서 Opus-5와 GPT-5.6 Sol을 능가합니다.
오픈 웨이트 모델은 Hugging Face를 통해 MIT 라이선스로 제공되며, vLLM, SGLang, Transformers를 지원하고 낮은, 높은, 최대 추론 tiers를 갖춘 공개 API를 제공합니다.