DeepSeek ha lanzado DeepSeek-V4.1-Flash, un modelo Mixture-of-Experts multimodal diseñado para abordar los altos costos del procesamiento de contexto largo y los grandes cachés KV en cargas de trabajo de agentes.
El modelo presenta una arquitectura Causal Encoder-Decoder que activa solo 8B parámetros durante el prefill, en comparación con 16B durante el decode. Logra una huella global de caché KV de 890 bytes por token combinando Compressed Sparse Attention 2 con almacenamiento en caché FP4, lo cual es aproximadamente una cuarta parte de la línea base DeepSeek-V4-Flash. El uso persistente de caché KV en SSD o memoria del host se reduce a aproximadamente una octava parte de la versión anterior mediante la optimización SWA Bounded Replay. El modelo fue preentrenado con un corpus multimodal de 45T tokens y soporta contextos de hasta un millón de tokens.
Estos cambios arquitectónicos mejoran sustancialmente la eficiencia de costos para cargas de trabajo intensivas en entrada, mientras ofrecen mejor rendimiento que la línea base a pesar de la huella de memoria significativamente menor.