O Kimi K3, um modelo de pesos abertos da Moonshot AI, alcança desempenho comparável ao Claude Fable 5 da Anthropic no benchmark DeepSWE, enquanto custa significativamente menos por tarefa. Em uma avaliação de 16 de julho de 2026, o Kimi K3 atingiu 68,5% de pass@1 em comparação com os 69,9% do Fable 5, mas superou-o em cenários de múltiplas tentativas e ofereceu maior eficiência de custo.
- O Kimi K3 custa US$ 4,65 por rollout versus US$ 13,41 para o Claude Fable 5, entregando 2,8 vezes mais tarefas resolvidas por dólar.
- Embora o Fable 5 lidera na confiabilidade de tentativa única (69,9% contra 68,5%), o Kimi K3 vence no pass@2 (82,0% contra 80,2%) e no pass@4 (89,4% contra 88,5%).
- O Kimi K3 abrange uma gama mais ampla de tarefas, resolvendo 101 tarefas exclusivas em comparação com as 107 do Fable 5, com forte desempenho em Go.
- Os modelos mostram alta correlação (0,72) e padrões de falha semelhantes, o que significa que não fornecem diversidade significativa quando combinados.
O Kimi K3 é posicionado como uma escolha padrão racional para trabalho de agentes de alto volume ou tolerante a retrabalho devido à sua natureza de pesos abertos e menor custo, apesar da ligeira vantagem do Fable 5 na confiabilidade de tentativa única.