llama.cpp 프로젝트는 dsv4 prefill에 sparse-fa를 활성화하는 CUDA 최적화를 포함한 버전 b11140을 출시했습니다. 이 업데이트는 컴파일 타임 루프 언롤링을 허용하기 위해 커널을 템플릿화하여 flash attention 마스크 스캔 프로세스의 성능 문제를 해결합니다.

  • `flash_attn_mask_to_sparse_indices`의 쿼리 루프가 이제 컴파일 타임에 제한되어, 49k 열이 있는 스파스 디코드 형태에서 스캔 시간을 46마이크로초에서 17마이크로초로 줄였습니다.
  • 스파스 마스크 스캔에 대한 아웃오브바운즈 체크가 호스트 코드로 이동되어, 49k 컨텍스트에서의 배치 스파스 연산 시간이 586마이크로초에서 244마이크로초로 감소했습니다.

이 릴리스는 CPU, GPU 및 NPU 백엔드를 위한 macOS, Linux, Windows, Android 및 openEuler용 바이너리를 제공합니다.