llama.cpp 프로젝트는 CUDA 백엔드의 치명적인 버그를 해결한 버전 b10241을 출시했습니다. 이 업데이트는 블록 리덕션 동안 공유 메모리(SMEM)를 재사용할 때 발생하는 데이터 레이스 문제를 해결합니다.
- block_reduce에서 SMEM 읽기 후 동기화 부재를 수정하여 데이터 레이스 방지.
- 단일 행 softmax 및 정규화 연산에 대해 더블 버퍼링 구현.
- 멀티 와프 시나리오를 위해 설명 주석 및 메모리 배리어 추가.
- CPU, CUDA, Vulkan, ROCm 및 기타 백엔드를 위한 macOS, Linux, Windows, Android, iOS용 바이너리 제공.