llama.cpp b10728 릴리스는 Flash Attention K,V 공유 메모리 fp16 타일에 대한 CUDA XOR swizzle 구현을 도입합니다. 이 업데이트는 DGX Spark 하드웨어에서 Flash Attention의 공유 메모리 레이스 조건도 해결합니다.

  • CUDA용 fp16 타일이 있는 XOR swizzle flash attention을 구현합니다.
  • 32비트 공유 포인터 대신 64비트 범용 포인터 사용을 수정합니다.
  • swizzle 테스트 케이스를 추가하고 동기화를 swizzled 경로로만 제한합니다.
  • nbatch_2%32==0인 비 2의 거듭제곱 형태에 대한 swizzling을 허용합니다.
  • Flash Attention swizzle ldmatrix 로직을 헬퍼 함수로 리팩토링합니다.

이 릴리스는 CPU, CUDA, Vulkan, ROCm, OpenVINO 및 SYCL 백엔드에 대해 macOS, Linux, Windows, Android 및 openEuler용 바이너리를 제공합니다.