Este artículo describe una secuencia específica de artículos de investigación e informes de modelos para ayudar a los lectores a comprender la evolución técnica detrás del modelo Kimi K3 de Moonshot AI. Argumenta que K3 no es un lanzamiento aislado, sino la convergencia de varias líneas de investigación distintas, incluidos los mecanismos de atención lineal y los diseños dispersos de Mezcla de Expertos (Mixture-of-Experts).
- Los Transformadores Lineales son Programadores Ocultos de Pesos Dinámicos: Establece la base interpretando la atención lineal como un sistema que actualiza la memoria asociativa.
- Gated DeltaNet (arXiv:2412.06464): Introduce actualizaciones delta con compuertas para mejorar la gestión del estado en secuencias largas.
- Kimi Linear / Kimi Delta Attention (KDA): Presenta la arquitectura híbrida de atención lineal que sirve como columna vertebral de K3.
- LatentMoE y Stable LatentMoE: Detalla la formulación de enrutamiento en el espacio latente y su evolución, lo que permite a K3 activar 16 de los 896 expertos enrutados por token.
- Residuos de Atención (arXiv:2603.15031): Explica el mecanismo que permite al modelo decidir cómo utilizar las redes residuales para mejorar el flujo de información.
- Evolución del Modelo Kimi: Rastrea la progresión desde Kimi K1.5 a través de K2.5 hasta K3, mostrando cómo cada iteración refinó las recetas de entrenamiento y la infraestructura.
Seguir este camino proporciona el contexto necesario para entender por qué se tomaron decisiones arquitectónicas específicas en Kimi K3, en lugar de verlo como un producto independiente.