Компания DeepSeek выпустила экспериментальную мультимодальную модель понимания изображений под названием DeepSeek-V4-Flash-Vision-Exp, которая теперь доступна на платформе API DeepSeek. Эта новая модель предназначена для улучшения визуальных возможностей при сохранении паритета с её текстовой версией.

  • Модель доступна через API путем установки параметра модели в 'deepseek-v4-flash-vision-exp'.
  • Она демонстрирует значительные улучшения на бенчмарках агентов, требующих визуального понимания, приближая возможности мультимодальных агентов к Opus-4.8.
  • В отношении чистых текстовых возможностей, таких как агент, рассуждение и мировые знания, она работает на уровне официального DeepSeek-V4-Flash.
  • Результаты бенчмарков включают Terminal Bench 2.1 — 83.9, Chartography — 64.3 и DSBench-Hard — 59.3.

Этот релиз предоставляет пользователям новый инструмент для мультимодальных задач, сохраняя при этом надежную текстовую производительность модели DeepSeek-V4-Flash.