DeepSeek a mis à jour son modèle V4 Flash, en publiant une nouvelle version le 2026-07-31 qui affiche des gains de performance significatifs par rapport à la précédente version d'aperçu. La mise à jour introduit des résultats pour plusieurs nouveaux benchmarks tout en améliorant les scores sur ceux existants.

  • Le score Terminal Bench est passé de 56,9 à 82,7 (note : le benchmark a changé de v2.0 à v2.1).
  • Le score Toolathlon est passé de 51,8 à 70,3.
  • Les nouveaux résultats de benchmarks incluent NL2Repo (54,2), Cybergym (76,7), DeepSWE (54,4), Agent Last Exam (25,2), Automation Bench (25,1), DSBench-FullStack (68,7) et DSBench-Hard (59,6).
  • Par rapport à GPT-5.6 Terra, V4 Flash mène sur Terminal Bench (+4,3) et Toolathlon (+17,2), tandis que Terra mène sur DeepSWE (+15,2) et Agents' Last Exam (+25,2).

La mise à jour fournit une version plus performante du modèle pour les tâches liées aux agents, bien que la performance par rapport aux concurrents comme GPT-5.6 Terra reste mitigée selon le benchmark spécifique.