El proyecto llama.cpp ha lanzado la versión b10514, que introduce infraestructura de conversión para las arquitecturas IBM's GraniteSWAForCausalLM y GraniteMoeSWAForCausalLM. Esta actualización permite a los usuarios convertir estos tipos específicos de modelos al formato GGUF para su uso con llama.cpp.
- Añadido soporte feat(convert) para GraniteSWAForCausalLM y GraniteMoeSWAForCausalLM.
- Implementada infraestructura de conversión para arrays rope_pattern y determinación de rope por capa.
- Corregida la lógica del patrón SWA para soportar capas non-rope y corregido el nombre para ffn gate inp.
- Actualizado llama_hparams con constantes has_rope y eliminados fallbacks rope_finetuned hacky.
- Incluidos binarios para macOS, Linux, Windows y Android a través de CPU, CUDA, Vulkan, OpenCL y otros backends.
Este lanzamiento permite que el ecosistema llama.cpp soporte nativamente los modelos IBM's sliding window attention, ampliando la gama de arquitecturas compatibles disponibles para inferencia local.