O projeto llama.cpp lançou a versão b10514, que introduz infraestrutura de conversão para as arquiteturas IBM's GraniteSWAForCausalLM e GraniteMoeSWAForCausalLM. Esta atualização permite aos usuários converter esses tipos específicos de modelos para o formato GGUF para uso com llama.cpp.

  • Adicionado suporte feat(convert) para GraniteSWAForCausalLM e GraniteMoeSWAForCausalLM.
  • Implementada infraestrutura de conversão para arrays rope_pattern e determinação de rope por camada.
  • Corrigida a lógica do padrão SWA para suportar camadas non-rope e corrigido o nome para ffn gate inp.
  • Atualizado llama_hparams com constantes has_rope e removidos fallbacks rope_finetuned hacky.
  • Incluídos binários para macOS, Linux, Windows e Android através de CPU, CUDA, Vulkan, OpenCL e outros backends.

Este lançamento permite que o ecossistema llama.cpp suporte nativamente os modelos IBM's sliding window attention, expandindo a gama de arquiteturas compatíveis disponíveis para inferência local.