Le projet llama.cpp a ajouté la prise en charge du modèle textuel Kimi-K3, implémentant son architecture d'attention hybride KDA (linéaire) + MLA (complet) ainsi que cinq caractéristiques architecturales spécifiques absentes de l'ancien Kimi-Linear-48B.

  • L'implémentation inclut l'attention résiduelle inter-couches, MoE latent, activation contextuelle remplaçant SwiGLU, une porte de sortie MLA et une porte KDA de rang complet.
  • Les experts routés sont livrés sous forme de tenseurs compressés au format « mxfp4-pack-quantized », qui est bit-à-bit compatible avec le MXFP4 de ggml pour permettre un reconditionnement sans perte sans déquantification.
  • Un nouveau modèle de chat gère le format balisé XTML-ish de Kimi-K3 pour le raisonnement, le contenu et les appels d'outils, incluant des délimiteurs de message spécifiques et une division des spans au niveau des tokens.
  • Le convertisseur corrige les erreurs de type et augmente LLAMA_MAX_EXPERTS de 512 à 1024, tandis que le sauveur du modèle émet désormais correctement le paramètre kda_gate_lower_bound pour préserver la fidélité aller-retour.

Cette mise à jour permet aux utilisateurs d'exécuter Kimi-K3 localement avec une exactitude bout-en-bout vérifiée par rapport à l'implémentation de référence de Moonshot et aux données de génération réelles.