A Moonshot AI apresentou o Kimi K3, um modelo Mixture-of-Experts de código aberto com 2,8 trilhões de parâmetros totais e 104 bilhões de parâmetros ativados por token. O modelo oferece capacidades nativas de visão e uma janela de contexto de 1 milhão de tokens, aproveitando o Kimi Delta Attention e o Stable LatentMoE para alcançar uma eficiência de escalabilidade aproximadamente 2,5 vezes superior à do seu antecessor, Kimi K2.
- O Kimi K3 utiliza Kimi Delta Attention e Attention Residuals para melhorar o fluxo de informações ao longo do comprimento da sequência e da profundidade do modelo.
- O Stable LatentMoE ativa efetivamente 16 dos 896 especialistas roteados por token.
- O pós-treinamento inclui aprendizado por reforço nos domínios geral, agêntico e de programação, com múltiplos níveis de esforço de raciocínio.
- O modelo alcança desempenho de ponta em tarefas de programação de longo prazo, agênticas, de conhecimento, raciocínio e visão.
- Embora fique atrás do Claude Fable 5 e do GPT-5.6 Sol, supera outros modelos avaliados, tanto abertos quanto proprietários.
A Moonshot AI está liberando os pesos completos do modelo Kimi K3 para facilitar pesquisas futuras e acelerar a implantação mais ampla de inteligência de ponta.