llama.cpp 프로젝트는 IBM's GraniteSWAForCausalLM 및 GraniteMoeSWAForCausalLM 아키텍처를 위한 변환 인프라를 도입한 버전 b10514를 출시했습니다. 이 업데이트는 사용자가 이러한 특정 모델 유형을 llama.cpp와 함께 사용하기 위해 GGUF 형식으로 변환할 수 있도록 합니다.
- GraniteSWAForCausalLM 및 GraniteMoeSWAForCausalLM에 대한 feat(convert) 지원 추가.
- rope_pattern 배열 및 레이어별 rope 결정에 대한 변환 인프라 구현.
- non-rope 레이어를 지원하도록 SWA 패턴 로직 수정 및 ffn gate inp 명명 수정.
- has_rope 상수로 llama_hparams 업데이트 및 hacky rope_finetuned 폴백 제거.
- CPU, CUDA, Vulkan, OpenCL 및 기타 백엔드를 위한 macOS, Linux, Windows 및 Android용 바이너리 포함.
이 릴리스로 인해 llama.cpp 생태계는 IBM's sliding window attention 모델을 네이티브로 지원하여 로컬 추론에 사용할 수 있는 호환 아키텍처 범위를 확장합니다.