El artículo informa de que Kimi K3 (max) supera a Sonnet 5 en la prueba de referencia Simple Bench.
- Kimi K3 (max) obtiene una puntuación más alta que Sonnet 5 en esta evaluación específica.
El artículo informa de que Kimi K3 (max) supera a Sonnet 5 en la prueba de referencia Simple Bench.
Un estudio comparó el sistema de IA clínica Doctorina con ocho médicos y cuatro modelos de lenguaje fronterizos independientes en 150 consultas sintéticas de atención primaria en polaco.
Un usuario evaluó Kimi K3 frente a Claude Opus 4.8 ejecutando 34 prompts de un solo ejemplo y evaluando el HTML, capturas de pantalla y GIF resultantes utilizando Sonnet 4.6. La evaluación concluyó que Kimi K3 produjo mejores resultados que Opus 4.8.
Kimi K3, un modelo de pesos abiertos de Moonshot AI, logra un rendimiento comparable al de Claude Fable 5 de Anthropic en el benchmark DeepSWE mientras cuesta significativamente menos por tarea. En una evaluación del 16 de julio de 2026, Kimi K3 alcanzó un 68,5% de pass@1 frente al 69,9% de Fable 5, pero lo superó en escenarios de múltiples intentos y ofreció una mayor eficiencia de costos.
Según el tablero de clasificación de Agent Arena, Kimi K3 tiene un rendimiento comparable al de Opus en tareas no visuales. Aunque algunos usuarios señalan que Opus puede tener una ventaja en capacidades visuales, la clasificación indica igualdad para otros casos de uso.
Kimi K3 ha logrado la posición principal en la evaluación SpreadsheetBench 2 de AfterQuery. Este resultado lo coloca por delante de Claude Fable 5 en este benchmark específico.
Usamos cookies para medir el tráfico y mejorar el sitio. Puedes aceptar o rechazar las cookies de analítica. Política de privacidad