O projeto llama.cpp adicionou suporte ao modelo de texto Kimi-K3, implementando sua arquitetura de atenção híbrida KDA (linear) + MLA (completa), juntamente com cinco recursos arquitetônicos específicos ausentes no Kimi-Linear-48B mais antigo.

  • A implementação inclui atenção residual entre camadas, MoE latente, ativação situacional substituindo SwiGLU, porta de saída MLA e porta KDA de posto completo.
  • Os especialistas roteados são entregues como tensores compactados usando o formato "mxfp4-pack-quantized", que é bit-compatível com o MXFP4 do ggml para permitir repacking sem perda de precisão sem desquantização.
  • Um novo template de chat lida com o formato XTML-ish marcado do Kimi-K3 para raciocínio, conteúdo e chamadas de ferramenta, incluindo delimitadores de mensagem específicos e divisão de span em nível de token.
  • O conversor corrige erros de tipo e aumenta LLAMA_MAX_EXPERTS de 512 para 1024, enquanto o salvador do modelo agora emite corretamente o parâmetro kda_gate_lower_bound para preservar a fidelidade da viagem de ida e volta.

Esta atualização permite que os usuários executem o Kimi-K3 localmente com correção ponta a ponta verificada contra a implementação de referência da Moonshot e dados reais de geração.