llama.cpp 프로젝트는 Hexagon 백엔드에 대한 최적화를 포함한 빌드 b11272을 출시했습니다. 주요 변경 사항은 Qualcomm Snapdragon 하드웨어에서 성능을 향상시키기 위해 연결 연산을 최적화하는 것입니다.

  • gather/transpose 핫 루프 내의 패킷 수를 줄이고 대상 버퍼에 직접 수집하며 gather 동기화를 위한 특수 명령어를 사용했습니다.
  • 더 빠른 계산을 위해 소프트웨어 나눗셈 호출을 fastdiv로 대체했습니다.
  • DMA-HVX 파이프라인을 최적화하고 Hexagon 연결 연산용 전치 헬퍼를 추가했습니다.

이 업데이트는 macOS, Linux, Windows, Android 및 openEuler에 대한 다양한 CPU, GPU 및 NPU 백엔드용 바이너리를 제공합니다.