llama.cpp 프로젝트는 f16 flash attention의 ggml-cuda 구현 내 분기된 배리어 문제에 대한 수정을 포함한 빌드 b10835를 출시했습니다. 이 업데이트는 동일한 모듈 내에서 중복 메타데이터 포인터 설정도 해결합니다.

  • ggml-cuda f16 flash attention의 분기된 배리어 수정 (PR #27870).
  • ggml-cuda에서 중복 메타데이터 포인터 설정 방지.

이 릴리스는 CUDA, Vulkan, ROCm, SYCL을 포함한 다양한 CPU 및 GPU 백엔드에 대해 macOS, Linux, Windows, Android, openEuler용 업데이트된 바이너리를 제공합니다.