DeepSeek 已更新其 V4 Flash 模型,于 2026-07-31 发布新版本,相比之前的预览版性能显著提升。此次更新引入了多个新基准测试的结果,并提升了现有基准的得分。

  • Terminal Bench 得分从 56.9 提升至 82.7(注:基准测试版本从 v2.0 变更为 v2.1)。
  • Toolathlon 得分从 51.8 上升至 70.3。
  • 新增的基准测试结果包括 NL2Repo (54.2)、Cybergym (76.7)、DeepSWE (54.4)、Agent Last Exam (25.2)、Automation Bench (25.1)、DSBench-FullStack (68.7) 和 DSBench-Hard (59.6)。
  • 与 GPT-5.6 Terra 相比,V4 Flash 在 Terminal Bench (+4.3) 和 Toolathlon (+17.2) 上领先,而 Terra 在 DeepSWE (+15.2) 和 Agents' Last Exam (+25.2) 上领先。

此次更新提供了更强大的模型版本以应对与智能体相关的任务,不过相对于 GPT-5.6 Terra 等竞争对手的性能表现则因具体基准测试而异。