DeepSeek telah merilis model pemahaman visual multimodal eksperimental bernama DeepSeek-V4-Flash-Vision-Exp, yang sekarang tersedia di platform API DeepSeek. Model baru ini dirancang untuk meningkatkan kemampuan visual sambil mempertahankan kesetaraan dengan rekan teks-only-nya.
- Model dapat diakses melalui API dengan menetapkan parameter model ke 'deepseek-v4-flash-vision-exp'.
- Model ini mencapai peningkatan signifikan pada benchmark agen yang memerlukan pemahaman visual, membawa kemampuan agen multimodal mendekati Opus-4.8.
- Dalam hal kemampuan teks murni seperti agen, penalaran, dan pengetahuan dunia, model ini berkinerja setara dengan DeepSeek-V4-Flash resmi.
- Skor benchmark termasuk Terminal Bench 2.1 di 83.9, Chartography di 64.3, dan DSBench-Hard di 59.3.
Rilis ini menyediakan pengguna dengan alat baru untuk tugas multimodal sambil mempertahankan kinerja berbasis teks yang kuat dari model DeepSeek-V4-Flash.