llama.cpp 프로젝트가 빌드 b11039를 출시하여, SWA를 사용하는 모든 모델에 대해 슬라이딩 윈도우 어텐션(SWA) 패턴과 MLA SWA 기하학을 기록하도록 모델 저장소를 업데이트했습니다. 이 변경으로 `sliding_window_pattern`이 스칼라로 축소되지 않고 레이어별 플래그로 기록되어 정확한 데이터 표현이 보존됩니다.
- 로더는 이제 `llama_model_base::load_swa_pattern()`을 통해 SWA 패턴을 주기 또는 레이어별 배열로 읽으며, olmo2, gemma3n, exaone4의 컨버터에서 배열이 묵시적으로 무시되는 문제를 수정했습니다.
- 모델 저장소는 SWA 레이어에 대한 MLA 키/값 길이와 KV LoRA 랭크를 기록하며, 이는 dots3note에서 필요합니다.
- 이로 인해 plamo3, gemma3, cohere2, cohere2moe, olmo2, exone-moe, afmoe, mimo2, spark2_5, muse-glimmer, mellum, laguna, granite_swa, dots3note, maple에 대한 저장소가 활성화됩니다.
- 나열된 모든 모델은 test-llama-archs의 비트 정확성 라운드트립을 통과합니다.
이 업데이트는 llama.cpp에서 생성된 GGUF 파일이 의도된 SWA 구성과 일치하도록 보장하며, 기본 주기에 의존한 기존 게시된 파일의 출력은 변경하지 않습니다.