Uma avaliação interna de modelos de peso aberto em tarefas agênticas difíceis encontrou o DeepSeek v4 flash como a opção mais rápida e barata entre seus pares. O teste envolveu fluxos de trabalho de longa duração em vários aplicativos, avaliados por verificações determinísticas que exigem sucesso total.

  • DeepSeek v4 flash concluiu as tarefas em 164 segundos, quase 2,5 vezes mais rápido que o GLM 5.2 e 1,4 vezes mais rápido que o Kimi K3.
  • O custo por tarefa foi de aproximadamente $0,08 para o DeepSeek, comparado a $0,57 para o GLM 5.2 e $1,39 para o Kimi K3.
  • As taxas de sucesso foram quase idênticas entre os três modelos: o DeepSeek obteve 20/30, enquanto GLM e Kimi marcaram 21/30 cada.
  • Apesar das taxas de sucesso inferiores às dos modelos de fronteira como Fable 5 (24/30) e GPT-5.6 Sol (24/30), o DeepSeek ofereceu uma vantagem significativa de desempenho em velocidade e eficiência de custo.

Os resultados sugerem que, embora os modelos de ponta permaneçam superiores em capacidade bruta, o DeepSeek v4 flash fornece uma alternativa altamente eficiente para fluxos de trabalho agênticos.