llama.cpp 프로젝트는 AMD Strix Halo 하드웨어를 타겟팅하는 Vulkan 백엔드를 위한 특정 최적화를 포함하는 빌드 b10714를 출시했습니다. 이 업데이트는 배치 추론 중 성능을 향상시키기 위해 행렬-벡터 곱셈 행 수를 조정합니다.

  • Vulkan: 4개 이상의 열을 가진 RDNA3 아키텍처에서 mat-vec 작업에 대해 정적 4행을 설정하며, 이 구성은 기본값보다 벤치마크에서 더 빠릅니다.
  • Vulkan: Strix Halo 머신에서 mul_mat_vec_id에 대해 정적 4행 설정을 적용하며, 기본값과 비교하여 다양한 유형 및 배치 크기에서 더 빠른 것으로 입증되었습니다.

이러한 변경 사항은 Strix Halo와 같은 RDNA3 기반 GPU에서 llama.cpp를 실행하는 사용자에게 실질적인 성능 향상을 제공합니다.