llama.cpp 프로젝트는 Intel Xe-LP 그래픽 하드웨어에 대한 OpenCL 특정 최적화를 포함하는 버전 b10723을 출시했습니다. 이 업데이트는 양자화 커널을 조정하여 텐서 생성(TG) 및 프리필(PP) 성능을 개선하는 데 중점을 둡니다.
- Intel 장치에서 2x 활성화 재사용을 가능하게 하기 위해 N_DST 값을 증가하도록 Q4_K 및 Q5_K mul_mv 연산을 조정했습니다.
- Intel 아키텍처를 위해 Q4_K 및 Q5_K mul_mm 연산에 대해 8x8 타일 구성을 구현했습니다.
- 데이터 처리를 추가로 최적화하기 위해 Q4_K mul_mv의 N_DST를 8에서 16으로 증가시켰습니다.
이 릴리스는 CUDA, Vulkan, ROCm, SYCL을 포함한 다양한 백엔드에 대한 macOS, Linux, Windows, Android 및 iOS용 업데이트된 바이너리를 제공합니다.