llama.cpp 프로젝트는 Q4_K 다열 행렬-벡터 곱셈(MMVQ)을 위한 SYCL 백엔드 최적화를 포함한 빌드 b10777을 출시했습니다. 이번 업데이트는 가중치 언패킹 및 활성화 재사용 전략을 통해 중복 계산 작업을 줄이는 데 중점을 둡니다.

  • Q4_K 가중치 언패킹을 최적화하고 대상 열 간에 데이터를 재사용합니다.
  • 두 출력 행에 걸쳐 작은 N 값(N=2..4)에 대한 활성화의 서브그룹 재구현을 구현합니다.
  • 효율성을 높이기 위해 두 행 재사용 패턴을 N=2로 특정하게 게이트합니다.
  • 매직 넘버 임계값을 Q4_K_MMVQ_ROW_PAIR_MIN_NROWS=6272로 업데이트하고 Q4_K MUL_MAT 커버리지에 대한 성능 테스트를 추가합니다.

이 릴리스는 CPU, CUDA, ROCm, Vulkan, OpenVINO 및 SYCL을 포함한 다양한 하드웨어 백엔드용 macOS, Linux, Android, Windows 및 openEuler용 사전 빌드 바이너리를 제공합니다.