DeepSeek ha lanzado oficialmente el modelo DeepSeek V4.1 Flash, la entrada más pequeña en su nueva serie de arquitecturas que cuenta con comprensión visual multimodal nativa. Construido sobre un diseño Causal-Encoder-Decoder, es un modelo Mixture of Experts (MoE) de 552B parámetros que activa solo 8B parámetros en el lado de entrada y 16B en el lado de salida.

  • La arquitectura asimétrica reduce significativamente los costos de inferencia en comparación con los modelos conocidos del mismo tamaño.
  • La compresión de KV cache reduce los requisitos de HBM a 1/4 y los requisitos de SSD a 1/8 de la generación anterior, reduciendo los costos para tareas tipo agente.
  • Las pruebas de benchmark muestran que V4.1 Flash supera el nivel de inteligencia de modelos insignia incluyendo DeepSeek V4 Pro.
  • El modelo ya está disponible en la API de DeepSeek bajo el nombre `deepseek-flash`, con las variantes antiguas de V4 Flash redirigidas temporalmente a él.
  • Los precios se han ajustado con tarifas pico/fuera de pico, y las solicitudes a `deepseek-v4-pro` se enrutarán a V4.1 Flash después del 14 de septiembre de 2026.

La nueva arquitectura apunta a proporcionar un techo de capacidad más alto, inferencia más rápida, mayor rendimiento y escalabilidad hacia modelos de mayor parámetro mientras atiende a más usuarios con menor costo.