Компания DeepSeek AI выпустила модель DeepSeek-V4.1-Flash, мультимодальную Mixture-of-Experts модель с контекстным окном на 1 миллион токенов и FP4 KV-кэшем, который сокращает глобальный размер кэша до 890 байт на токен. Модель использует причинно-следующую архитектуру кодировщика-декодировщика и Compressed Sparse Attention 2 (CSA2) для значительного снижения требований к памяти при сохранении производительности.

  • Модель имеет 552B параметров основной части, 196B параметров Engram и активирует 8B параметров на этапе префилла и 16B на этапе декодирования.
  • Причинно-следующая структура кодировщика-декодировщика вдвое сокращает вычисления при префилле за счёт получения глобального KV декодера из финального скрытого состояния кодировщика.
  • CSA2 распределяет слои по режимам Full, Reindex или Reuse для совместного использования основных KV-кэшей и индексов между слоями.
  • FP4-квантование основного KV-кэша сокращает объём хранилища по сравнению с FP8-кэшем V4 почти вдвое.
  • Модель демонстрирует уровень знаний о мире и навыков программирования, сопоставимый с DeepSeek-V4-Pro-Base, при использовании 1/3 от общего числа параметров.
  • Она превосходит Opus-5 и GPT-5.6 Sol в бенчмарках Terminal-Bench 2.1 и DeepSWE v1.1.

Модель с открытыми весами доступна по лицензии MIT через платформу Hugging Face с поддержкой vLLM, SGLang и Transformers, предлагая публичный API с тремя уровнями рассуждений: низким, высоким и максимальным.