DeepSeekがネイティブマルチモーダルサポートを備えたV4.1-Flashモデルをリリース
DeepSeekは、新しいアーキテクチャファミリーの最小メンバーであり、ネイティブなマルチモーダル視覚理解機能を備えたDeepSeek-V4.1-Flashモデルを正式にリリースしました。この新しいアーキテクチャは、より高い能力の上限、より高速な推論速度、より高いスループット、および大規模モデルのためのより良いスケーリングの可能性を提供するように設計されています。
DeepSeekは、新しいアーキテクチャファミリーの最小メンバーであり、ネイティブなマルチモーダル視覚理解機能を備えたDeepSeek-V4.1-Flashモデルを正式にリリースしました。この新しいアーキテクチャは、より高い能力の上限、より高速な推論速度、より高いスループット、および大規模モデルのためのより良いスケーリングの可能性を提供するように設計されています。
DeepSeekは、極限の推論効率と低コストを実現するために設計された新しいオープンウェイトのフラッグシップモデルであるV4.1-Flashをリリースしました。このモデルは、アクティブな計算量とKV/キャッシュのコストを大幅に削減するために、因果的なエンコーダ・デコーダアーキテクチャを利用しています。
DeepSeekは、新しいオープンウェイトのフラッグシップモデルであるDeepSeek v4.1-Flashをリリースしました。このモデルは、推論効率を最大化しコストを削減するために設計された新たな因果エンコーダ・デコーダアーキテクチャを採用しています。
DeepSeek AIは、100万トークンのコンテキストウィンドウと、グローバルキャッシュのフットプリントをトークンあたり890バイトに削減するFP4 KVキャッシュを備えたマルチモーダルMixture-of-ExpertsモデルであるDeepSeek-V4.1-Flashをリリースしました。このモデルは、因果的なエンコーダ・デコーダアーキテクチャとCompressed Sparse Attention 2 (CSA2) を活用し、パフォーマンスを維持しながらメモリ要件を大幅に削減しています。
DeepSeek は Huawei の Ascend 950 ハードウェアを使用してモデルのトレーニングを行っています。この動きは、26 か月前に誰かがフロンティアに出る必要があると述べた Liang Wenfeng の声明に続くものです。
中国の規制当局は、米企業のAnthropicへの潜在的なデータ漏洩についてDeepSeekおよびMoonshot AIを調査している。この調査はKimiの幹部に関する噂に端を発するものの、現時点では確認された逮捕ではなく調査段階と説明されている。
DeepSeekは現在、2兆パラメータの新モデルをトレーニングしており、最終的に8兆パラメータのモデルを構築する計画です。
研究者らは、オープンソースのコードベースに実装された機能を用いて、ソースコードを唯一の入力として強化学習環境を構築するエージェントパイプライン「CodeMidas」を紹介した。 本手法は、エージェント計算資源を割り当てて機能を探索し、実行に根ざしたテストを構築し、反復ロールアウトを通じてタスクを検証することで、23のプログラミング言語にわたる5,545件のトレーニングデータセットを生成する。 これらのタスクでGRPOを用いてMiMo-V2.5を訓練すると、DeepSWE (+11.7%)、ProgramBench (+17%)、Terminal-Bench v2.1 (+8.5%) など5つの多様なベンチマークでパフォーマンスが向上した。 軌跡分析により、RLで訓練されたエージェントは、コードベースの探索増加やより多様な自己検証など、より優れた行動を示すことが示唆された。 これらの結果は、多様なソフトウェアタスクにおけるコーディングエージェントを改善するRL環境を構築するためのスケーラブルな基盤として、ソースコードを確立するものである。
DeepSeekは、エージェントワークロードにおける長時間コンテキスト計算と大規模なKVキャッシュの高額コストに対処するために設計されたマルチモーダルMixture-of-Expertsモデル「DeepSeek-V4.1-Flash」をリリースしました。
Atria Dawn Preview は、科学的研究およびエンジニアリングワークフローのために設計された基盤エージェント型言語モデルであり、ツールを介した相互作用を実行可能環境に接続する検証可能な経験パイプラインを通じてトレーニングされています。現実の研究、エンジニアリング、デジタル作業にわたる16のベンチマークにおいて、このモデルは最先端のエージェントと競争力があり、そのうち5つで最高の報告スコアを達成しています。
DeepSeek V4.1 Flash は、Artificial Analysis Intelligence Index v4.3 のアップデートにおいて、新しい Astra ベンチマークで第1位となりました。
あるユーザーが、DeepSeek V4.1モデルをNVIDIA A100 GPUで実行し、公式APIを上回るパフォーマンスを実現するカスタム実装を開発しました。
LiveBenchベンチマークプラットフォームは、評価スイートにDeepSeek v4.1 Flashモデルを追加しました。
DeepSeek V4.1 Flash モデルが HuggingChat プラットフォームを通じてアクセス可能になりました。
あるユーザーが、新しくリリースされた DeepSeek V4.1 Flash モデルを使用して生成された動画を公開し、モーションビデオ合成におけるその能力をベンチマークしました。
DeepSeekは新しいモデル「DeepSeek V4-1 Flash」をリリースしました。これは、5520億パラメータのバックボーンを持つマルチモーダルMixture-of-Experts (MoE)モデルです。
DeepSeekは、ネイティブなマルチモーダル視覚理解機能を備えた新アーキテクチャシリーズの最小型モデルであるDeepSeek V4.1 Flashを正式にリリースした。因果的エンコーダ・デコーダ設計に基づき、入力側で8Bパラメータ、出力側で16Bパラメータのみを活性化させる552BパラメータのMixture of Experts (MoE)モデルである。
DeepSeek は DeepSeek V4 Pro モデルをソフトリタイアしました。この措置により、AI システムのこの特定バージョンの利用終了が示されました。
DeepSeek は、その DeepSeek V4.1 Flash モデルの中間バージョンの内部ベータテストを開始し、現在は API を介して利用可能です。