llama.cpp 프로젝트는 gfx1201 아키텍처에서 CUDA/HIP용 Flash Attention에 대한 특정 튜닝을 포함한 빌드 b10905를 출시했습니다. 이 업데이트는 AMD RDNA4 GPU의 성능 최적화에 중점을 둡니다.

  • HIP: RDNA4에서 head size 256에 대한 행렬 곱 가속(mma) Flash Attention을 활성화하고 관련 구성을 튜닝합니다.
  • HIP: AMD WMMA 아키텍처에서 stream-k보다 전체 타일 Flash Attention 그리드를 선호합니다.
  • 실행 흐름 개선을 위해 stream_k 로직을 개정했습니다.
  • 더 나은 하드웨어 타겟팅을 위해 커널 선택 로직을 개정했습니다.

이 릴리스는 CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL 및 OpenCL을 비롯한 다양한 백엔드를 통해 macOS, Linux, Windows, Android 및 openEuler에 대한 바이너리를 제공합니다.