llama.cpp 프로젝트는 OpenVINO 백엔드에 상당한 업데이트를 병합했으며, 주로 Qwen3.5 모델 계열에 대한 지원을 활성화하고 여러 메모리 최적화 기법을 도입했습니다.
- GPT-OSS MoE, MXFP4, FILL, SIGMOID, SQR, SQRT 및 다차원 set rows 연산을 활성화했습니다.
- Gemma3n, Phi-3-mini (NEOX RoPE), MPT, Kimi-linear, Minimax-m3 아키텍처의 정확도 문제를 수정했습니다.
- GGML_OPENVINO_RELEASE_WEIGHTS를 구현하여 컴파일 후 호스트 가중치 RSS를 해제하고, Arc iGPU에서 Llama-3.2-1B-Q4_K_M에 대해 정상 상태 메모리 사용량을 약 1555 MB에서 약 710 MB로 줄였습니다.
- 스트리밍 가중치 재양자화를 추가하여 1B 모델의 컴파일 시간 피크 RSS를 1.06 GB, 8B 모델의 경우 2.0 GB 줄였습니다.
- 반복적인 로드 시 그래프 변환 및 컴파일을 건너뛰기 위해 프론트엔드 모델 캐시(GGML_OPENVINO_MODEL_CACHE_DIR)를 도입했습니다.
이러한 변경 사항은 Qwen3.5와 같은 최신 아키텍처와의 호환성을 개선하고 GPU 추론을 위한 과도한 컴파일 시간 및 정상 상태 메모리 사용량을 크게 줄입니다.