Le projet llama.cpp a publié la version b10514, qui introduit une infrastructure de conversion pour les architectures IBM's GraniteSWAForCausalLM et GraniteMoeSWAForCausalLM. Cette mise à jour permet aux utilisateurs de convertir ces types de modèles spécifiques au format GGUF pour une utilisation avec llama.cpp.

  • Ajout du support feat(convert) pour GraniteSWAForCausalLM et GraniteMoeSWAForCausalLM.
  • Mise en œuvre de l'infrastructure de conversion pour les tableaux rope_pattern et la détermination du rope par couche.
  • Correction de la logique du motif SWA pour prendre en charge les couches non-rope et correction du nommage pour ffn gate inp.
  • Mise à jour de llama_hparams avec des constantes has_rope et suppression des fallbacks rope_finetuned hacky.
  • Inclusion de binaires pour macOS, Linux, Windows et Android via CPU, CUDA, Vulkan, OpenCL et autres backends.

Cette version permet à l'écosystème llama.cpp de prendre en charge nativement les modèles IBM's sliding window attention, élargissant la gamme d'architectures compatibles disponibles pour l'inférence locale.