Este artigo delineia uma sequência específica de artigos de pesquisa e relatórios de modelos para ajudar os leitores a compreender a evolução técnica por trás do modelo Kimi K3 da Moonshot AI. Argumenta-se que o K3 não é um lançamento isolado, mas a convergência de vários ramos de pesquisa distintos, incluindo mecanismos de atenção linear e designs esparsos de Mixture-of-Experts.
- Linear Transformers Are Secretly Fast Weight Programmers: Estabelece a base ao interpretar a atenção linear como um sistema que atualiza a memória associativa.
- Gated DeltaNet (arXiv:2412.06464): Introduz atualizações delta com portão para melhorar o gerenciamento de estado em sequências longas.
- Kimi Linear / Kimi Delta Attention (KDA): Apresenta a arquitetura híbrida de atenção linear que serve como espinha dorsal do K3.
- LatentMoE e Stable LatentMoE: Detalha a formulação de roteamento no espaço latente e sua evolução, o que permite ao K3 ativar 16 dos 896 especialistas roteados por token.
- Attention Residuals (arXiv:2603.15031): Explica o mecanismo que permite ao modelo decidir como usar redes residuais para um melhor fluxo de informações.
- Kimi Model Evolution: Rastreia a progressão do Kimi K1.5 através do K2.5 até o K3, mostrando como cada iteração refinou as receitas de treinamento e a infraestrutura.
Seguir este caminho fornece o contexto necessário para entender por que escolhas arquiteturais específicas foram feitas no Kimi K3, em vez de vê-lo como um produto isolado.