Uma comparação entre DeepSeek V4 Pro 0813 e Claude Fable 5 no benchmark DeepSWE revela que uma estratégia de roteamento usando ambos os modelos resolve 82,7% das tarefas a $8,28 cada, superando o uso exclusivo do Fable (69,7%) e sendo significativamente mais barata.

  • Claude Fable 5 lidera em precisão de tentativa única (69,7% pass@1) e se destaca em Rust (85%) e trabalhos com alta carga de serialização, mas custa $21,63 por rollout, cerca de 90 vezes mais que o DeepSeek V4 Pro 0813.
  • DeepSeek V4 Pro 0813 é mais barato ($0,24 por rollout) e alcança maior precisão com múltiplas tentativas (88,5% pass@4 contra 84,1% do Fable), tornando-o a melhor opção de custo-benefício para trabalho em alta escala ou tolerante a retrabalho.
  • Os modelos apresentam baixa correlação por tarefa (0,39), cobrindo 107 das 113 tarefas entre si, o que justifica uma abordagem em cascata: executar o Pro primeiro e escalar para o Fable apenas quando necessário.

A análise sugere que o Fable 5 deve ser usado como uma escalada seletiva para domínios específicos como Rust, em vez de um modelo padrão, enquanto o DeepSeek V4 Pro 0813 oferece precisão próxima à do Fable por uma fração do custo.