llama.cpp 프로젝트가 빌드 b10672를 출시했으며, 이는 OpenVINO 백엔드를 버전 2026.3.1로 업데이트하고 NPU에서 Whisper.cpp 모델에 대한 지원을 추가합니다.

  • OpenVINO 백엔드가 이제 IM2COL + MatMul 합성곱을 단일 OpenVINO 합성곱 연산으로 병합합니다.
  • Qwen3.5 모델이 업데이트된 백엔드를 통해 NPU에서 실행되도록 활성화되었습니다.
  • RELU, POOL_2D, QUICK_GEGLU 및 ROLL을 포함한 새로운 연산이 OpenVINO 백엔드에서 지원됩니다.
  • 정적 형태 처리가 수정되어 동적 슬롯 차원 전파 및 토큰 수 독립성 문제를 해결했습니다.
  • 청크 기반 프리필 로직이 수정되어 패딩된 토큰이 재귀 캐시에 영구적으로 병합되지 않도록 방지했습니다.
  • GGML_OPENVINO_NPU_COMPILE_CONFIG라는 새로운 환경 변수를 통해 사용자가 최적화 수준=3과 같은 NPU 컴파일 매개변수를 구성할 수 있습니다.

이 업데이트는 특히 Intel NPUs를 타겟팅하는 사용자를 위해 OpenVINO 사용자의 추론 성능 및 모델 호환성을 개선합니다.