Uma comparação entre Kimi K3 e GPT-5.6 Sol no benchmark DeepSWE revela que, embora o GPT-5.6 Sol lidera em qualidade de tiro único (72,7% contra 68,5%), o Kimi K3 alcança pontuações pass@k mais altas para k > 1 com um custo significativamente menor.
- Kimi K3 vence no pass@2 (82,0% contra 81,0%) e pass@4 (89,4% contra 85,8%), atingindo o melhor pass@4 de qualquer configuração de nível flagship.
- O Kimi K3 custa US$ 4,65 por rollout em comparação com os US$ 8,37 do GPT-5.6 Sol, entregando 2,8x mais tarefas resolvidas por dólar.
- Os modelos divergem significativamente (correlação de 0,46) e falham de maneira diferente, permitindo uma cascata com prioridade para Kimi e escalonamento para o Sol para cobrir 108 das 113 tarefas.
- O GPT-5.6 Sol é mais confiável, resolvendo 61 tarefas quatro vezes em quatro contra as 45 do Kimi K3, mas leva mais tempo por rollout (17 minutos contra 66 minutos).
O roteamento entre os dois modelos oferece uma solução prática robusta, com uma cascata com prioridade para Kimi atingindo cerca de 85,6% de precisão enquanto é mais barata do que usar apenas o GPT-5.6 Sol.