DeepSeek ha actualizado su modelo V4 Flash, lanzando una nueva versión el 2026-07-31 que muestra ganancias significativas de rendimiento sobre la vista previa anterior. La actualización introduce resultados para varios nuevos benchmarks mientras mejora las puntuaciones en los existentes.
- La puntuación de Terminal Bench aumentó de 56.9 a 82.7 (nota: el benchmark cambió de v2.0 a v2.1).
- La puntuación de Toolathlon subió de 51.8 a 70.3.
- Los nuevos resultados de benchmarks incluyen NL2Repo (54.2), Cybergym (76.7), DeepSWE (54.4), Agent Last Exam (25.2), Automation Bench (25.1), DSBench-FullStack (68.7) y DSBench-Hard (59.6).
- En comparación con GPT-5.6 Terra, V4 Flash lidera en Terminal Bench (+4.3) y Toolathlon (+17.2), mientras que Terra lidera en DeepSWE (+15.2) y Agents' Last Exam (+25.2).
La actualización proporciona una versión más capaz del modelo para tareas relacionadas con agentes, aunque el rendimiento en relación con competidores como GPT-5.6 Terra sigue siendo mixto dependiendo del benchmark específico.