llama.cpp 프로젝트는 특정 모델 구성에 대한 OpenCL 성능 수정을 포함한 버전 b10246을 출시했습니다. 이 업데이트는 원래 차원 조건이 큰 가중치를 처리하기에 불충분했던 문제를 해결합니다.

  • 대형 q6_K lm_head 텐서를 gemv_noshuffle 대신 평평한 GEMV로 라우팅합니다.
  • gemma-4 E2B(차원 [1536, 262144])와 같은 모델의 성능 저하를 방지하기 위해 직접적인 크기 조건을 추가합니다.
  • macOS(Apple Silicon 및 Intel), Linux(CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows(CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP) 및 openEuler용 바이너리를 제공합니다.

이 변경은 성능 병목 현상을 유발하지 않고 OpenCL 장치에서 큰 가중치 행렬을 효율적으로 처리하도록 보장합니다.