DeepSeek a publié un modèle expérimental de compréhension visuelle multimodale nommé DeepSeek-V4-Flash-Vision-Exp, désormais disponible sur la plateforme API de DeepSeek. Ce nouveau modèle est conçu pour améliorer les capacités visuelles tout en maintenant une parité avec sa contrepartie uniquement textuelle.

  • Le modèle est accessible via l'API en définissant le paramètre du modèle sur 'deepseek-v4-flash-vision-exp'.
  • Il réalise des améliorations significatives sur les benchmarks d'agents nécessitant une compréhension visuelle, rapprochant les capacités des agents multimodaux de Opus-4.8.
  • En termes de capacités purement textuelles telles que l'agent, le raisonnement et la connaissance du monde, il est au niveau du DeepSeek-V4-Flash officiel.
  • Les scores des benchmarks incluent Terminal Bench 2.1 à 83.9, Chartography à 64.3 et DSBench-Hard à 59.3.

Cette publication offre aux utilisateurs un nouvel outil pour les tâches multimodales tout en conservant la performance textuelle robuste du modèle DeepSeek-V4-Flash.