Une évaluation interne des modèles à poids ouvert sur des tâches agentic complexes a révélé que DeepSeek v4 flash était l'option la plus rapide et la moins chère parmi ses pairs. Le test impliquait des workflows de longue durée sur plusieurs applications, évalués par des vérifications déterministes exigeant un succès complet.

  • DeepSeek v4 flash a terminé les tâches en 164 secondes, près de 2,5 fois plus rapide que GLM 5.2 et 1,4 fois plus rapide que Kimi K3.
  • Le coût par tâche était d'environ 0,08 $ pour DeepSeek, contre 0,57 $ pour GLM 5.2 et 1,39 $ pour Kimi K3.
  • Les taux de réussite étaient presque identiques pour les trois modèles : DeepSeek a obtenu 20/30, tandis que GLM et Kimi ont chacun marqué 21/30.
  • Malgré des taux de réussite inférieurs à ceux des modèles de pointe comme Fable 5 (24/30) et GPT-5.6 Sol (24/30), DeepSeek offrait un avantage significatif en vitesse et en efficacité coût.

Les résultats suggèrent que, bien que les modèles de pointe restent supérieurs pour la capacité brute, DeepSeek v4 flash fournit une alternative hautement efficace pour les workflows agentic.