Le projet llama.cpp a publié la version b10514, qui introduit une infrastructure de conversion pour les architectures IBM's GraniteSWAForCausalLM et GraniteMoeSWAForCausalLM. Cette mise à jour permet aux utilisateurs de convertir ces types de modèles spécifiques au format GGUF pour une utilisation avec llama.cpp.
- Ajout du support feat(convert) pour GraniteSWAForCausalLM et GraniteMoeSWAForCausalLM.
- Mise en œuvre de l'infrastructure de conversion pour les tableaux rope_pattern et la détermination du rope par couche.
- Correction de la logique du motif SWA pour prendre en charge les couches non-rope et correction du nommage pour ffn gate inp.
- Mise à jour de llama_hparams avec des constantes has_rope et suppression des fallbacks rope_finetuned hacky.
- Inclusion de binaires pour macOS, Linux, Windows et Android via CPU, CUDA, Vulkan, OpenCL et autres backends.
Cette version permet à l'écosystème llama.cpp de prendre en charge nativement les modèles IBM's sliding window attention, élargissant la gamme d'architectures compatibles disponibles pour l'inférence locale.