DeepSeek 发布了一款名为 DeepSeek-V4-Flash-Vision-Exp 的实验性多模态视觉理解模型,现已在 DeepSeek API 平台上提供。该新模型旨在增强视觉能力,同时与其纯文本版本保持同等水平。
- 用户可以通过将模型参数设置为 'deepseek-v4-flash-vision-exp' 通过 API 访问该模型。
- 它在需要视觉理解的智能体基准测试中取得了显著改进,使多模态智能体能力接近 Opus-4.8。
- 在纯文本能力方面,如智能体、推理和世界知识,其表现与官方 DeepSeek-V4-Flash 相当。
- 基准分数包括 Terminal Bench 2.1 为 83.9,Chartography 为 64.3,DSBench-Hard 为 59.3。
此次发布为用户提供了用于多模态任务的新工具,同时保留了 DeepSeek-V4-Flash 模型强大的文本性能。