llama.cpp 프로젝트는 ggml-cpu 백엔드에 대한 업데이트를 포함한 빌드 b11232를 출시했습니다. 이번 릴리스는 x86 아키텍처에서 벡터 배수가 아닌 헤드 차원에 대해 타일드 플래시 어텐션을 활성화하는 데 중점을 둡니다.

  • x86에서 벡터 배수가 아닌 헤드 차원에 대해 타일드 플래시 어텐션 활성화.
  • simd_gemm_ukernel_tail의 마스크된 로딩 및 저장을 위한 AVX2 지원 추가.
  • 패딩된 KV 타일에 대한 FA softcap 처리 수정.

이 업데이트는 CPU, GPU 및 NPU 백엔드를 위해 macOS, Linux, Windows, Android 및 openEuler에 대한 바이너리를 제공합니다.