Компания DeepSeek выпустила экспериментальную мультимодальную модель понимания изображений под названием DeepSeek-V4-Flash-Vision-Exp, которая теперь доступна на платформе API DeepSeek. Эта новая модель предназначена для улучшения визуальных возможностей при сохранении паритета с её текстовой версией.
- Модель доступна через API путем установки параметра модели в 'deepseek-v4-flash-vision-exp'.
- Она демонстрирует значительные улучшения на бенчмарках агентов, требующих визуального понимания, приближая возможности мультимодальных агентов к Opus-4.8.
- В отношении чистых текстовых возможностей, таких как агент, рассуждение и мировые знания, она работает на уровне официального DeepSeek-V4-Flash.
- Результаты бенчмарков включают Terminal Bench 2.1 — 83.9, Chartography — 64.3 и DSBench-Hard — 59.3.
Этот релиз предоставляет пользователям новый инструмент для мультимодальных задач, сохраняя при этом надежную текстовую производительность модели DeepSeek-V4-Flash.