Le projet llama.cpp a publié la version b11039, qui met à jour le model-saver pour écrire les motifs d'attention à fenêtre glissante (SWA) et la géométrie MLA SWA pour tous les modèles utilisant SWA. Cette modification garantit que le `sliding_window_pattern` est écrit comme un indicateur par couche plutôt que d'être réduit à une valeur scalaire, préservant ainsi la représentation exacte des données.

  • Les chargeurs lisent désormais le motif SWA soit comme une période, soit comme un tableau par couche via `llama_model_base::load_swa_pattern()`, corrigeant les ignorances silencieuses des tableaux dans les convertisseurs pour olmo2, gemma3n et exaone4.
  • Le model-saver écrit les longueurs clés/valeurs MLA et le rang KV LoRA pour les couches SWA, ce qui est requis par dots3note.
  • Cela active le saver pour plamo3, gemma3, cohere2, cohere2moe, olmo2, exone-moe, afmoe, mimo2, spark2_5, muse-glimmer, mellum, laguna, granite_swa, dots3note et maple.
  • Tous les modèles listés passent le roundtrip bit-exact de test-llama-archs.

La mise à jour garantit que les fichiers GGUF générés par llama.cpp correspondent aux configurations SWA prévues sans modifier les sorties des fichiers publiés existants qui dépendaient de périodes par défaut.