llama.cpp 프로젝트는 CUDA 추론을 위한 성능 최적화를 도입한 버전 b10840을 출시했습니다. 이 업데이트는 행렬-벡터 곱셈(mmvp) 가속을 위해 Q4_K 및 Q5_K 양자화 형식에 대한 분기 없는 연산을 구현합니다.

  • 분기 없는 언팩은 mmvp의 각 열에 대해 스케일 재실행을 방지하여 배치 크기가 1보다 클 때 성능을 향상시킵니다.
  • L2 프리페치 로직은 DGX Spark 하드웨어에 대해 특별히 게이트되어 이점이 실현되도록 합니다.
  • mmvp L2 프리페치 가드는 CUDA와 함께 MUSA 및 HIP 백엔드를 지원하도록 확장되었습니다.
  • Q4_K의 스위치 포인트는 더 넓은 범위의 모델을 수용하기 위해 업데이트되었습니다.

이러한 변경은 1보다 큰 배치 크기로 DGX Spark 시스템에서 llama.cpp를 실행하는 사용자에게 측정 가능한 성능 향상을 제공합니다.