Kimi K3 alcançou a posição principal na avaliação SpreadsheetBench 2 da AfterQuery. Este resultado o coloca à frente do Claude Fable 5 neste benchmark específico.
Kimi K3 ocupa o #1 no SpreadsheetBench 2 da AfterQuery, superando o Claude Fable 5
Doctorina supera médicos no diagnóstico sintético de atenção primária em polonês
Um estudo comparou o sistema de IA clínica Doctorina com oito médicos e quatro modelos de linguagem fronteira autônomos em 150 consultas sintéticas de atenção primária em polonês.
Kimi K3 supera Opus 4.8 na geração HTML com um único exemplo
Um usuário avaliou o Kimi K3 em comparação ao Claude Opus 4.8, executando 34 prompts de um único exemplo e avaliando o HTML, capturas de tela e GIFs resultantes usando o Sonnet 4.6. A avaliação concluiu que o Kimi K3 produziu resultados melhores do que o Opus 4.8.
Kimi K3 iguala Claude Fable 5 na qualidade do DeepSWE com um terço do custo
O Kimi K3, um modelo de pesos abertos da Moonshot AI, alcança desempenho comparável ao Claude Fable 5 da Anthropic no benchmark DeepSWE, enquanto custa significativamente menos por tarefa. Em uma avaliação de 16 de julho de 2026, o Kimi K3 atingiu 68,5% de pass@1 em comparação com os 69,9% do Fable 5, mas superou-o em cenários de múltiplas tentativas e ofereceu maior eficiência de custo.
Kimi K3 se classifica no mesmo nível que Opus pensando no Agent Arena
De acordo com o ranking do Agent Arena, Kimi K3 tem desempenho comparável ao do Opus em tarefas não visuais. Embora alguns usuários notem que o Opus pode ter uma vantagem em capacidades visuais, a classificação indica igualdade para outros casos de uso.
Kimi K3 (max) supera o Sonnet 5 no Simple Bench
O artigo relata que o Kimi K3 (max) supera o Sonnet 5 na avaliação de referência Simple Bench.