DeepSeek обновил свою модель V4 Flash, выпустив новую версию 2026-07-31, которая демонстрирует значительный рост производительности по сравнению с предыдущей предварительной версией. Обновление включает результаты нескольких новых бенчмарков, а также улучшает показатели в существующих.
- Результат Terminal Bench вырос с 56.9 до 82.7 (примечание: бенчмарк изменился с v2.0 на v2.1).
- Результат Toolathlon вырос с 51.8 до 70.3.
- Новые результаты бенчмарков включают NL2Repo (54.2), Cybergym (76.7), DeepSWE (54.4), Agent Last Exam (25.2), Automation Bench (25.1), DSBench-FullStack (68.7) и DSBench-Hard (59.6).
- По сравнению с GPT-5.6 Terra, V4 Flash лидирует в Terminal Bench (+4.3) и Toolathlon (+17.2), тогда как Terra лидирует в DeepSWE (+15.2) и Agents' Last Exam (+25.2).
Обновление предоставляет более мощную версию модели для задач, связанных с агентами, хотя производительность по сравнению с конкурентами, такими как GPT-5.6 Terra, остается неоднозначной в зависимости от конкретного бенчмарка.