llama.cpp 프로젝트가 버전 b10427을 출시했으며, 여기에는 SYCL을 통한 Intel Arc GPU용 성능 최적화가 포함되어 있습니다. 이 업데이트는 q4_K 밀도 순방향 네트워크(FFN) 레이어 내에서 gate, up 및 GLU 연산의 융합을 구현합니다.

  • llama-bench를 사용하여 Arc Pro B70에서 측정했을 때, qwen2.5-3B-Instruct의 처리량은 2.8% 증가했고 gemma-2-2b-it은 2.0% 증가했습니다.
  • qwen2.5-3B에 대한 배치 추론 벤치마크는 상당한 개선을 보였습니다: 배치 크기 1에서 +3.4%, B=2에서 +10.1%로 증가, B=4에서 +10.7%, B=8에서 +12.4%.

이 릴리스에서는 CPU, CUDA, Vulkan, ROCm 및 OpenVINO 백엔드에 대해 macOS, Linux, Windows, Android 및 openEuler용 사전 컴파일된 바이너리를 제공합니다.