Kimi K3 liderou o novo ranking FullStack na arena.ai.
O modelo alcançou a primeira posição neste benchmark recém-introduzido.
Kimi K3 liderou o novo ranking FullStack na arena.ai.
O modelo alcançou a primeira posição neste benchmark recém-introduzido.
Um usuário avaliou o Kimi K3 em comparação ao Claude Opus 4.8, executando 34 prompts de um único exemplo e avaliando o HTML, capturas de tela e GIFs resultantes usando o Sonnet 4.6. A avaliação concluiu que o Kimi K3 produziu resultados melhores do que o Opus 4.8.
Uma comparação entre Kimi K3 e GPT-5.6 Sol no benchmark DeepSWE revela que, embora o GPT-5.6 Sol lidera em qualidade de tiro único (72,7% contra 68,5%), o Kimi K3 alcança pontuações pass@k mais altas para k > 1 com um custo significativamente menor.
O Kimi K3, um modelo de pesos abertos da Moonshot AI, alcança desempenho comparável ao Claude Fable 5 da Anthropic no benchmark DeepSWE, enquanto custa significativamente menos por tarefa. Em uma avaliação de 16 de julho de 2026, o Kimi K3 atingiu 68,5% de pass@1 em comparação com os 69,9% do Fable 5, mas superou-o em cenários de múltiplas tentativas e ofereceu maior eficiência de custo.
O lançamento do Kimi-K3 reduziu o atraso temporal entre as fronteiras de IA de código aberto e fechado para apenas 1,5 meses, segundo a Artificial Analysis.
De acordo com o ranking do Agent Arena, Kimi K3 tem desempenho comparável ao do Opus em tarefas não visuais. Embora alguns usuários notem que o Opus pode ter uma vantagem em capacidades visuais, a classificação indica igualdade para outros casos de uso.
Usamos cookies para medir o tráfego e melhorar o site. Você pode aceitar ou recusar os cookies de análise. Política de privacidade