El proyecto llama.cpp lanzó la compilación b11039, que actualiza el guardador de modelos para escribir patrones de atención de ventana deslizante (SWA) y geometría MLA SWA para todos los modelos que utilizan SWA. El cambio asegura que `sliding_window_pattern` se escriba como una bandera por capa en lugar de colapsarse a un escalar, preservando la representación exacta de los datos.

  • Los cargadores ahora leen el patrón SWA ya sea como un período o como una matriz por capa mediante `llama_model_base::load_swa_pattern()`, corrigiendo ignorancias silenciosas de matrices en convertidores para olmo2, gemma3n y exaone4.
  • El guardador de modelos escribe las longitudes de clave/valor MLA y el rango KV LoRA para las capas SWA, lo cual es requerido por dots3note.
  • Esto habilita el guardador para plamo3, gemma3, cohere2, cohere2moe, olmo2, exone-moe, afmoe, mimo2, spark2_5, muse-glimmer, mellum, laguna, granite_swa, dots3note y maple.
  • Todos los modelos enumerados pasan la vuelta exacta de bits de test-llama-archs.

La actualización asegura que los archivos GGUF generados por llama.cpp coincidan con las configuraciones SWA previstas sin alterar las salidas para archivos publicados existentes que dependían de períodos predeterminados.