Pesquisadores apresentam o Kimi K2, um modelo de linguagem grande do tipo Mixture-of-Experts com 32 bilhões de parâmetros ativados em um total de um trilhão. O modelo utiliza o novo otimizador MuonClip para lidar com a instabilidade do treinamento enquanto mantém a eficiência de tokens durante o pré-treinamento em 15,5 trilhões de tokens.

  • Kimi K2 alcança desempenho de ponta entre modelos abertos não pensantes, obtendo 66,1 no Tau2-Bench e 76,5 no ACEBench (En).
  • Ele atinge 65,8 no SWE-Bench Verified e 47,3 no SWE-Bench Multilingual, superando a maioria das linhas de base abertas e fechadas em configurações não pensantes.
  • O modelo demonstra fortes capacidades em codificação e raciocínio com pontuações de 53,7 no LiveCodeBench v6, 49,5 no AIME 2025 e 75,1 no GPQA-Diamond.
  • O pós-treinamento envolve um processo multiestágio incluindo síntese de dados agênticos em larga escala e aprendizado por reforço conjunto para melhorar as capacidades agênticas.

O lançamento dos checkpoints do modelo base e do pós-treinamento visa facilitar pesquisas futuras e aplicações de inteligência agêntica.