DeepSeekは、DeepSeek-V4-Flash-Vision-Exp という実験的なマルチモーダルビジョン理解モデルをリリースし、DeepSeek APIプラットフォームで利用可能になりました。この新しいモデルは、テキスト専用の対となるモデルと同等性を維持しながら、視覚能力を強化するように設計されています。

  • モデルは、モデルパラメータを 'deepseek-v4-flash-vision-exp' に設定することでAPI経由でアクセスできます。
  • 視覚理解を必要とするエージェントベンチマークで著しい改善を実現し、マルチモーダルエージェントの能力をOpus-4.8に近づけています。
  • エージェント、推論、世界知識などの純粋なテキスト能力については、公式のDeepSeek-V4-Flashと同等のパフォーマンスを発揮します。
  • ベンチマークスコアには、Terminal Bench 2.1で83.9、Chartographyで64.3、DSBench-Hardで59.3が含まれます。

このリリースにより、ユーザーはDeepSeek-V4-Flashモデルの堅牢なテキストベースのパフォーマンスを維持しながら、マルチモーダルタスクのための新しいツールを利用できるようになります。