llama.cpp의 ggml-openvino 백엔드가 버전 2026.4.1로 업데이트되어 성능 최적화, 확장된 연산자 지원, 개선된 장치 열거 기능이 도입되었습니다.
- Mixture-of-Experts (MoE) 라우팅과 GDN QK 정규화의 융합, GPU MoE 융합이 기본적으로 활성화됨.
- gemma-4와 같은 모델에서 fused gate-up 가중치 지원, Arc B390에서 prefill 처리량이 66.16 t/s에서 1608.73 t/s로 증가.
- 상태 유지 실행에서 rank-3 축 처리 수정으로 MoE 모델의 그래프 빌드 중단 문제 해결.
- PRD 준수 장치 열거 및 메모리 보고 구현으로 GPU/IGGPU 구분 정확성 보장.
- 디스크에서 직접 컴파일된 모델을 가져올 수 있는 k-requerq 옵션 q4_asym64와 cache_only 모드 추가.
이러한 변경 사항은 MoE 아키텍처의 추론 성능을 향상시키고 OpenVINO 사용자에게 더 신뢰할 수 있는 하드웨어 감지 및 구성을 제공합니다.