O projeto llama.cpp lançou a compilação b11039, que atualiza o model-saver para gravar padrões de atenção de janela deslizante (SWA) e geometria MLA SWA para todos os modelos que usam SWA. A alteração garante que o `sliding_window_pattern` seja gravado como um sinalizador por camada, em vez de ser colapsado para um escalar, preservando a representação exata dos dados.
- Os carregadores agora leem o padrão SWA como um período ou uma matriz por camada via `llama_model_base::load_swa_pattern()`, corrigindo ignorâncias silenciosas de matrizes em conversores para olmo2, gemma3n e exaone4.
- O model-saver grava os comprimentos das chaves/valores MLA e a classificação KV LoRA para as camadas SWA, o que é necessário pelo dots3note.
- Isso habilita o saver para plamo3, gemma3, cohere2, cohere2moe, olmo2, exone-moe, afmoe, mimo2, spark2_5, muse-glimmer, mellum, laguna, granite_swa, dots3note e maple.
- Todos os modelos listados passam pela rodada de bit-exact do test-llama-archs.
A atualização garante que os arquivos GGUF gerados pelo llama.cpp correspondam às configurações SWA pretendidas, sem alterar as saídas para arquivos publicados existentes que dependiam de períodos padrão.