Moonshot AI ha presentado Kimi K3, un modelo Mixture-of-Experts de código abierto que cuenta con 2.8 billones de parámetros totales y 104 mil millones de parámetros activados por token. El modelo admite capacidades nativas de visión y una ventana de contexto de 1 millón de tokens, aprovechando Kimi Delta Attention y Stable LatentMoE para lograr una eficiencia de escalado aproximada de 2.5x en comparación con su predecesor, Kimi K2.

  • Kimi K3 utiliza Kimi Delta Attention y Attention Residuals para mejorar el flujo de información a lo largo de la longitud de la secuencia y la profundidad del modelo.
  • Stable LatentMoE activa eficazmente 16 de los 896 expertos enrutados por token.
  • El post-entrenamiento incluye aprendizaje por refuerzo en dominios generales, agénticos y de codificación con múltiples niveles de esfuerzo de razonamiento.
  • El modelo alcanza un rendimiento de vanguardia en tareas de codificación a largo plazo, agénticas, de conocimiento, razonamiento y visión.
  • Aunque va detrás de Claude Fable 5 y GPT-5.6 Sol, supera a otros modelos evaluados tanto abiertos como propietarios.

Moonshot AI está liberando los pesos completos del modelo Kimi K3 para facilitar la investigación futura y acelerar el despliegue más amplio de la inteligencia de vanguardia.