O artigo relata que o Kimi K3 (max) supera o Sonnet 5 na avaliação de referência Simple Bench.
- O Kimi K3 (max) obtém uma pontuação mais alta que o Sonnet 5 nesta avaliação específica.
O artigo relata que o Kimi K3 (max) supera o Sonnet 5 na avaliação de referência Simple Bench.
Um estudo comparou o sistema de IA clínica Doctorina com oito médicos e quatro modelos de linguagem fronteira autônomos em 150 consultas sintéticas de atenção primária em polonês.
Um usuário avaliou o Kimi K3 em comparação ao Claude Opus 4.8, executando 34 prompts de um único exemplo e avaliando o HTML, capturas de tela e GIFs resultantes usando o Sonnet 4.6. A avaliação concluiu que o Kimi K3 produziu resultados melhores do que o Opus 4.8.
O Kimi K3, um modelo de pesos abertos da Moonshot AI, alcança desempenho comparável ao Claude Fable 5 da Anthropic no benchmark DeepSWE, enquanto custa significativamente menos por tarefa. Em uma avaliação de 16 de julho de 2026, o Kimi K3 atingiu 68,5% de pass@1 em comparação com os 69,9% do Fable 5, mas superou-o em cenários de múltiplas tentativas e ofereceu maior eficiência de custo.
De acordo com o ranking do Agent Arena, Kimi K3 tem desempenho comparável ao do Opus em tarefas não visuais. Embora alguns usuários notem que o Opus pode ter uma vantagem em capacidades visuais, a classificação indica igualdade para outros casos de uso.
Kimi K3 alcançou a posição principal na avaliação SpreadsheetBench 2 da AfterQuery. Este resultado o coloca à frente do Claude Fable 5 neste benchmark específico.
Usamos cookies para medir o tráfego e melhorar o site. Você pode aceitar ou recusar os cookies de análise. Política de privacidade