Kimi K3, un modelo de pesos abiertos de Moonshot AI, logra un rendimiento comparable al de Claude Fable 5 de Anthropic en el benchmark DeepSWE mientras cuesta significativamente menos por tarea. En una evaluación del 16 de julio de 2026, Kimi K3 alcanzó un 68,5% de pass@1 frente al 69,9% de Fable 5, pero lo superó en escenarios de múltiples intentos y ofreció una mayor eficiencia de costos.

  • Kimi K3 cuesta $4,65 por rollout frente a los $13,41 de Claude Fable 5, entregando 2,8 veces más tareas resueltas por dólar.
  • Aunque Fable 5 lidera en fiabilidad de intento único (69,9% frente a 68,5%), Kimi K3 gana en pass@2 (82,0% frente a 80,2%) y pass@4 (89,4% frente a 88,5%).
  • Kimi K3 cubre un rango más amplio de tareas, resolviendo 101 tareas únicas frente a las 107 de Fable 5, con un fuerte rendimiento en Go.
  • Los modelos muestran una alta correlación (0,72) y patrones de fallo similares, lo que significa que no proporcionan diversidad significativa cuando se emparejan.

Kimi K3 se posiciona como la opción racional por defecto para trabajos de agentes de alto volumen o tolerantes a reintentos debido a su naturaleza de pesos abiertos y menor costo, a pesar del ligero margen de Fable 5 en fiabilidad de intento único.