Kimi K3 ha encabezado el nuevo ranking FullStack en arena.ai.
El modelo logró la posición número uno en este benchmark recién introducido.
Kimi K3 ha encabezado el nuevo ranking FullStack en arena.ai.
El modelo logró la posición número uno en este benchmark recién introducido.
Un usuario evaluó Kimi K3 frente a Claude Opus 4.8 ejecutando 34 prompts de un solo ejemplo y evaluando el HTML, capturas de pantalla y GIF resultantes utilizando Sonnet 4.6. La evaluación concluyó que Kimi K3 produjo mejores resultados que Opus 4.8.
Una comparación entre Kimi K3 y GPT-5.6 Sol en el benchmark DeepSWE revela que, aunque GPT-5.6 Sol lidera en calidad de intento único (72.7% frente a 68.5%), Kimi K3 logra puntuaciones pass@k más altas para k > 1 con un costo significativamente menor.
Kimi K3, un modelo de pesos abiertos de Moonshot AI, logra un rendimiento comparable al de Claude Fable 5 de Anthropic en el benchmark DeepSWE mientras cuesta significativamente menos por tarea. En una evaluación del 16 de julio de 2026, Kimi K3 alcanzó un 68,5% de pass@1 frente al 69,9% de Fable 5, pero lo superó en escenarios de múltiples intentos y ofreció una mayor eficiencia de costos.
El lanzamiento de Kimi-K3 ha reducido la diferencia temporal entre las fronteras de IA de código abierto y cerrado a solo 1,5 meses, según Artificial Analysis.
Según el tablero de clasificación de Agent Arena, Kimi K3 tiene un rendimiento comparable al de Opus en tareas no visuales. Aunque algunos usuarios señalan que Opus puede tener una ventaja en capacidades visuales, la clasificación indica igualdad para otros casos de uso.
Usamos cookies para medir el tráfico y mejorar el sitio. Puedes aceptar o rechazar las cookies de analítica. Política de privacidad