O projeto llama.cpp lançou a versão b10514, que introduz infraestrutura de conversão para as arquiteturas IBM's GraniteSWAForCausalLM e GraniteMoeSWAForCausalLM. Esta atualização permite aos usuários converter esses tipos específicos de modelos para o formato GGUF para uso com llama.cpp.
- Adicionado suporte feat(convert) para GraniteSWAForCausalLM e GraniteMoeSWAForCausalLM.
- Implementada infraestrutura de conversão para arrays rope_pattern e determinação de rope por camada.
- Corrigida a lógica do padrão SWA para suportar camadas non-rope e corrigido o nome para ffn gate inp.
- Atualizado llama_hparams com constantes has_rope e removidos fallbacks rope_finetuned hacky.
- Incluídos binários para macOS, Linux, Windows e Android através de CPU, CUDA, Vulkan, OpenCL e outros backends.
Este lançamento permite que o ecossistema llama.cpp suporte nativamente os modelos IBM's sliding window attention, expandindo a gama de arquiteturas compatíveis disponíveis para inferência local.