llama.cpp b10981 릴리스는 OpenVINO 백엔드의 상태 디코딩 경로에서 중요한 정확성 문제를 해결하며, 특히 레이어별 헤드 크기를 사용하는 Gemma-4와 같은 모델에 대한 지원을 수정합니다. 또한 GPU Mixture of Experts (MoE) 추론을 위한 최적화를 도입하고 KV 상태 재배치를 통해 성능을 개선합니다.
- 레이어별 유형별 헤드 수와 슬라이딩 윈도우 레이어를 올바르게 처리하여 Gemma-4의 상태 디코딩 실패를 수정합니다.
- GPU에서의 상태 디코딩 성능을 개선하여, gemma-4-12B가 깊이 8192에서 6.27 t/s에서 9.11 t/s로 증가합니다.
- GGML_OPENVINO_REQUANT_KQUANT을 추가하여 4비트 재양자화 대상을 선택하고, GGML_OPENVINO_SPILL_DIR를 추가하여 가중치 버퍼를 디스크에 스플리시합니다.
- 전문가 블록을 MOECompressed에 융합하고 그룹화된 8비트 전문가를 재양자화하여 GPU MoE 추론을 최적화합니다.
- 패킹된 QKV RoPE 뷰를 허용하고 마스크에서 캐시리스 어텐션을 감지하여 NPU에서 캐시리스 인코더 모델을 활성화합니다.
- 정밀도를 유지하기 위해 불일치 연산자 유형을 f32로 업캐스팅하여 혼합 데이터 타입 ADD/SWIGLU_CLAMP 연산을 수정합니다.
이러한 변경은 Gemma-4와 같은 복잡한 모델 아키텍처에 대한 정확한 추론을 보장하며, 호환되는 하드웨어에서 상태 디코딩 및 MoE 워크로드에 대해 측정 가능한 속도 향상을 제공합니다.