El proyecto llama.cpp ha añadido soporte para el modelo de texto Kimi-K3, implementando su arquitectura de atención híbrida KDA (lineal) + MLA (completa) junto con cinco características arquitectónicas específicas ausentes en el antiguo Kimi-Linear-48B.

  • La implementación incluye atención residual entre capas, MoE latente, activación situacional que reemplaza a SwiGLU, una puerta de salida MLA y una puerta KDA de rango completo.
  • Los expertos enrutados se distribuyen como tensores comprimidos utilizando el formato "mxfp4-pack-quantized", que es compatible a nivel de bits con MXFP4 de ggml para permitir un reempaquetado sin pérdidas sin desquantización.
  • Una nueva plantilla de chat maneja el formato etiquetado XTML-ish de Kimi-K3 para razonamiento, contenido y llamadas a herramientas, incluyendo delimitadores de mensaje específicos y división de intervalos a nivel de token.
  • El convertidor corrige errores de tipo y aumenta LLAMA_MAX_EXPERTS de 512 a 1024, mientras que el guardador de modelos ahora emite correctamente el parámetro kda_gate_lower_bound para preservar la fidelidad de ida y vuelta.

Esta actualización permite a los usuarios ejecutar Kimi-K3 localmente con corrección extremo a extremo verificada frente a la implementación de referencia de Moonshot y datos de generación reales.