llama.cpp 프로젝트는 AMD의 gfx1201 아키텍처에서 Q2_0 양자화 내적 경로에 대한 특정 최적화를 포함하는 버전 b10702를 출시했습니다. 이 업데이트는 HIP 구현을 네이티브 amdgcn 순서 바꾸기 명령어를 사용하도록 확장하여 이 특정 하드웨어 구성의 성능을 향상시킵니다.

  • gfx1201용 `vec_dot_q2_0_q8_1`을 네이티브 amdgcn 순서 바꾸기로 최적화합니다.
  • HIP의 Q2_0 순서 바꾸기 최적화를 확장하고 중복 가용성 가드를 제거합니다.
  • 네이티브 순서 바꾸기 명령어를 사용하여 HIP Q2_0 MMQ 언팩을 최적화합니다.
  • MMQ 타일 인덱스 처리를 복원하고 CUDA 코드에서 HIP 전처리기 가드에 레이블을 붙입니다.

이 릴리스는 CPU, GPU(CUDA, ROCm, Vulkan, OpenCL) 및 OpenVINO, SYCL과 같은 전용 백엔드를 위한 macOS, Linux, Windows, Android, openEuler용 바이너리를 제공합니다.