DeepSeekは、エージェントワークロードにおける長時間コンテキスト計算と大規模なKVキャッシュの高額コストに対処するために設計されたマルチモーダルMixture-of-Expertsモデル「DeepSeek-V4.1-Flash」をリリースしました。

本モデルはCausal Encoder-Decoderアーキテクチャを採用しており、prefill時に8Bのパラメータのみをアクティブ化し、decode時には16Bとなります。Compressed Sparse Attention 2とFP4キャッシングを組み合わせることで、グローバルKVキャッシュフットプリントはトークンあたり890バイトとなり、DeepSeek-V4-Flashのベースラインの約4分の1です。SWA Bounded Replay最適化により、SSDまたはホストメモリ上の永続的なKVキャッシュ使用量は前バージョンの約8分の1に削減されました。本モデルは45Tトークンのマルチモーダルコーパスで事前学習されており、最大100万トークンのコンテキストをサポートします。

これらのアーキテクチャ変更により、入力集中型のワークロードのコスト効率性が大幅に向上し、メモリフットプリントが著しく小さいにもかかわらず、ベースラインよりも優れたパフォーマンスを実現しています。