一项针对开源权重模型在复杂智能体任务上的内部评估发现,DeepSeek v4 flash 是其中速度最快且成本最低的选项。该测试涉及跨多个应用的长运行工作流,并通过要求完全成功的确定性检查进行评分。

  • DeepSeek v4 flash 完成任务耗时 164 秒,比 GLM 5.2 快近 2.5 倍,比 Kimi K3 快 1.4 倍。
  • 每个任务的成本约为 0.08 美元,而 GLM 5.2 为 0.57 美元,Kimi K3 为 1.39 美元。
  • 三个模型的成功率几乎相同:DeepSeek 达到 20/30,而 GLM 和 Kimi 均得分为 21/30。
  • 尽管成功率低于 Fable 5 (24/30) 和 GPT-5.6 Sol (24/30) 等前沿模型,DeepSeek 在速度和成本效率方面提供了显著的性能优势。

结果表明,虽然最先进模型在原始能力上仍占优势,但 DeepSeek v4 flash 为智能体工作流提供了一个高效的选择。