DeepSeek telah merilis model pemahaman visual multimodal eksperimental bernama DeepSeek-V4-Flash-Vision-Exp, yang sekarang tersedia di platform API DeepSeek. Model baru ini dirancang untuk meningkatkan kemampuan visual sambil mempertahankan kesetaraan dengan rekan teks-only-nya.

  • Model dapat diakses melalui API dengan menetapkan parameter model ke 'deepseek-v4-flash-vision-exp'.
  • Model ini mencapai peningkatan signifikan pada benchmark agen yang memerlukan pemahaman visual, membawa kemampuan agen multimodal mendekati Opus-4.8.
  • Dalam hal kemampuan teks murni seperti agen, penalaran, dan pengetahuan dunia, model ini berkinerja setara dengan DeepSeek-V4-Flash resmi.
  • Skor benchmark termasuk Terminal Bench 2.1 di 83.9, Chartography di 64.3, dan DSBench-Hard di 59.3.

Rilis ini menyediakan pengguna dengan alat baru untuk tugas multimodal sambil mempertahankan kinerja berbasis teks yang kuat dari model DeepSeek-V4-Flash.