ハードなエージェントタスクにおけるオープンウェイトモデルの内部評価により、DeepSeek v4 flashが同種のモデルの中で最速かつ最安のコストパフォーマンスを示したことが判明した。このテストでは、複数のアプリケーションにわたる長時間実行されるワークフローが実施され、完全な成功を必要とする決定論的なチェックによって採点された。
- DeepSeek v4 flashは164秒でタスクを完了し、GLM 5.2より約2.5倍、Kimi K3より1.4倍高速だった。
- タスクあたりのコストはDeepSeekで約0.08ドルに対し、GLM 5.2は0.57ドル、Kimi K3は1.39ドルだった。
- 成功率は3つのモデル間でほぼ同等であり、DeepSeekが20/30、GLMとKimiがそれぞれ21/30を記録した。
- Fable 5(24/30)やGPT-5.6 Sol(24/30)といった最先端モデルと比較すると成功率は低かったものの、DeepSeekは速度とコスト効率において顕著な性能優位性を示した。
これらの結果は、最先端モデルが純粋な能力面では依然として優れている一方で、DeepSeek v4 flashがエージェントワークフローに対して極めて効率的な代替手段を提供することを示唆している。