Внутренняя оценка моделей с открытым весом на сложных агентных задачах показала, что DeepSeek v4 flash является самым быстрым и дешевым вариантом среди аналогов. Тестирование включало длительные рабочие процессы в нескольких приложениях, оцениваемые по детерминированным проверкам, требующим полного успеха.

  • DeepSeek v4 flash выполнил задачи за 164 секунды, почти в 2,5 раза быстрее GLM 5.2 и в 1,4 раза быстрее Kimi K3.
  • Стоимость одной задачи составила около $0,08 для DeepSeek, по сравнению с $0,57 для GLM 5.2 и $1,39 для Kimi K3.
  • Уровни успеха были почти идентичны для всех трех моделей: DeepSeek достиг 20/30, тогда как GLM и Kimi каждый получили 21/30.
  • Несмотря на более низкие показатели успеха по сравнению с передовыми моделями, такими как Fable 5 (24/30) и GPT-5.6 Sol (24/30), DeepSeek обеспечил значительное преимущество в скорости и эффективности затрат.

Результаты указывают на то, что, хотя модели высшего уровня остаются превосходными по базовой мощности, DeepSeek v4 flash предоставляет высокоэффективную альтернативу для агентных рабочих процессов.