Una evaluación interna de modelos de peso abierto en tareas agénticas difíciles encontró que DeepSeek v4 flash era la opción más rápida y económica entre sus pares. La prueba involucró flujos de trabajo de larga duración en múltiples aplicaciones, evaluados mediante comprobaciones deterministas que requerían éxito total.

  • DeepSeek v4 flash completó las tareas en 164 segundos, casi 2.5 veces más rápido que GLM 5.2 y 1.4 veces más rápido que Kimi K3.
  • El costo por tarea fue de aproximadamente $0.08 para DeepSeek, en comparación con $0.57 para GLM 5.2 y $1.39 para Kimi K3.
  • Las tasas de éxito fueron casi idénticas entre los tres modelos: DeepSeek logró 20/30, mientras que GLM y Kimi obtuvieron cada uno 21/30.
  • A pesar de tener tasas de éxito más bajas que los modelos de vanguardia como Fable 5 (24/30) y GPT-5.6 Sol (24/30), DeepSeek ofreció una ventaja significativa en velocidad y eficiencia de costos.

Los resultados sugieren que, aunque los modelos de última generación siguen siendo superiores en capacidad bruta, DeepSeek v4 flash proporciona una alternativa altamente eficiente para flujos de trabajo agénticos.