DeepSeek ha lanzado un modelo experimental de comprensión visual multimodal llamado DeepSeek-V4-Flash-Vision-Exp, ahora disponible en la plataforma API de DeepSeek. Este nuevo modelo está diseñado para mejorar las capacidades visuales manteniendo la paridad con su contraparte solo de texto.

  • El modelo se puede acceder a través de la API estableciendo el parámetro del modelo en 'deepseek-v4-flash-vision-exp'.
  • Logra mejoras significativas en benchmarks de agentes que requieren comprensión visual, acercando las capacidades de agentes multimodales a Opus-4.8.
  • En términos de capacidades puramente textuales como agente, razonamiento y conocimiento mundial, rinde al mismo nivel que el DeepSeek-V4-Flash oficial.
  • Las puntuaciones de los benchmarks incluyen Terminal Bench 2.1 en 83.9, Chartography en 64.3 y DSBench-Hard en 59.3.

Este lanzamiento proporciona a los usuarios una nueva herramienta para tareas multimodales mientras conserva el rendimiento textual robusto del modelo DeepSeek-V4-Flash.