llama.cpp b10256 릴리스에는 SYCL 장치에 대한 비연속 연결 커널을 병렬화하기 위한 변경 사항이 포함되어 있습니다. 업데이트는 단일 레인 워크 그룹에서 `SYCL_CONCAT_BLOCK_SIZE`를 사용하는 워크 그룹으로 실행 기하학을 수정합니다.
- SYCL 비연결 연결 커널은 이제 병렬성을 개선하기 위해 더 넓은 워크 그룹을 실행합니다.
- Qwen3.6-27B 가 탑재된 Arc Pro B70 에서의 벤치마크는 9.4% 처리량 증가(920 에서 1006 t/s)를 보여줍니다.
- 릴리스는 CPU, CUDA, Vulkan, ROCm, OpenVINO 및 SYCL 백엔드를 위해 macOS, Linux, Windows, Android 및 openEuler 에 대한 바이너리를 제공합니다.
이 최적화는 SYCL 백엔드를 사용하는 Intel GPU 에서 추론 성능을 향상시킵니다.