Kimi K3 ha logrado la posición principal en la evaluación SpreadsheetBench 2 de AfterQuery. Este resultado lo coloca por delante de Claude Fable 5 en este benchmark específico.
Kimi K3 ocupa el #1 en SpreadsheetBench 2 de AfterQuery, superando a Claude Fable 5
Doctorina supera a los médicos en el diagnóstico sintético de atención primaria en polaco
Un estudio comparó el sistema de IA clínica Doctorina con ocho médicos y cuatro modelos de lenguaje fronterizos independientes en 150 consultas sintéticas de atención primaria en polaco.
Kimi K3 supera a Opus 4.8 en la generación HTML con un solo ejemplo
Un usuario evaluó Kimi K3 frente a Claude Opus 4.8 ejecutando 34 prompts de un solo ejemplo y evaluando el HTML, capturas de pantalla y GIF resultantes utilizando Sonnet 4.6. La evaluación concluyó que Kimi K3 produjo mejores resultados que Opus 4.8.
Kimi K3 iguala a Claude Fable 5 en calidad de DeepSWE con un tercio del costo
Kimi K3, un modelo de pesos abiertos de Moonshot AI, logra un rendimiento comparable al de Claude Fable 5 de Anthropic en el benchmark DeepSWE mientras cuesta significativamente menos por tarea. En una evaluación del 16 de julio de 2026, Kimi K3 alcanzó un 68,5% de pass@1 frente al 69,9% de Fable 5, pero lo superó en escenarios de múltiples intentos y ofreció una mayor eficiencia de costos.
Kimi K3 se clasifica al mismo nivel que Opus pensando en Agent Arena
Según el tablero de clasificación de Agent Arena, Kimi K3 tiene un rendimiento comparable al de Opus en tareas no visuales. Aunque algunos usuarios señalan que Opus puede tener una ventaja en capacidades visuales, la clasificación indica igualdad para otros casos de uso.
Kimi K3 (max) supera a Sonnet 5 en Simple Bench
El artículo informa de que Kimi K3 (max) supera a Sonnet 5 en la prueba de referencia Simple Bench.