어려운 에이전트 작업에 대한 오픈 가중치 모델의 내부 평가 결과, DeepSeek v4 flash가 동종 제품군 중 가장 빠르고 저렴한 옵션으로 나타났습니다. 이 테스트는 여러 애플리케이션에 걸친 장기 실행 워크플로우를 포함했으며, 완전한 성공이 필요한 결정론적 검사를 통해 점수가 매겨졌습니다.
- DeepSeek v4 flash는 164초 만에 작업을 완료하여 GLM 5.2보다 약 2.5배 빠르고 Kimi K3보다 1.4배 빨랐습니다.
- 작업당 비용은 DeepSeek의 경우 약 $0.08인 반면, GLM 5.2는 $0.57, Kimi K3는 $1.39였습니다.
- 세 모델 모두 성공률은 거의 동일했습니다: DeepSeek는 20/30을 달성한 반면, GLM과 Kimi는 각각 21/30의 점수를 받았습니다.
- Fable 5 (24/30) 및 GPT-5.6 Sol (24/30)과 같은 최첨단 모델보다 낮은 성공률을 보였지만, DeepSeek는 속도와 비용 효율성 측면에서 상당한 성능 우위를 제공했습니다.
이 결과는 최신 모델이 원본 능력 면에서는 여전히 우수하지만, DeepSeek v4 flash가 에이전트 워크플로우에 대해 매우 효율적인 대안을 제공한다는 것을 시사합니다.