llama.cpp b11095 릴리스는 HMX 최적화된 GATED_DELTA_NET (GDN) 구현을 도입하고 Hexagon 및 Flash Attention 커널에 대한 다양한 최적화를 제공합니다.

  • GDN 지원에는 Qualcomm 칩에서 성능을 향상시키기 위한 파이프라이닝, HVX 스레딩 및 벡터 연산이 포함됩니다.
  • Flash Attention 업데이트는 레지스터 내 누적 및 DMA 파이프라인 개선을 통해 토큰 생성 중 DDR 읽기를 20-30% 줄입니다.
  • 이 릴리스는 CPU, CUDA, ROCm, Vulkan 및 OpenVINO 백엔드를 위한 macOS, Linux, Windows, Android 및 openEuler용 바이너리를 제공합니다.

이 업데이트는 기존 배포 환경과의 넓은 호환성을 유지하면서 특정 하드웨어 아키텍처에서 추론 효율성을 향상시킵니다.