Проект llama.cpp выпустил сборку b11039, которая обновляет model-saver для записи паттернов скользящего окна внимания (SWA) и геометрии MLA SWA для всех моделей, использующих SWA. Изменение гарантирует, что `sliding_window_pattern` записывается как флаг на уровне каждого слоя, а не сводится к скаляру, сохраняя точное представление данных.
- Загрузчики теперь считывают паттерн SWA либо как период, либо как массив для каждого слоя через `llama_model_base::load_swa_pattern()`, исправляя молчаливое игнорирование массивов в конвертерах для olmo2, gemma3n и exaone4.
- model-saver записывает длины ключей/значений MLA и ранг KV LoRA для слоёв SWA, что требуется dots3note.
- Это позволяет использовать saver для plamo3, gemma3, cohere2, cohere2moe, olmo2, exone-moe, afmoe, mimo2, spark2_5, muse-glimmer, mellum, laguna, granite_swa, dots3note и maple.
- Все перечисленные модели проходят битово точный цикл чтения-записи теста test-llama-archs.
Обновление гарантирует, что файлы GGUF, сгенерированные llama.cpp, соответствуют заданным конфигурациям SWA, не изменяя выходные данные для существующих опубликованных файлов, которые опирались на периоды по умолчанию.