llama.cpp 프로젝트는 `CUDA_ARCH` 매크로를 MUSA 디바이스 패스에 대해 정의하는 수정 사항을 포함하는 빌드 b11282를 출시했습니다. 이전에는 MUSA 벤더 헤더가 이 변수를 정의하지 않아 공유 ggml-cuda 소스의 아키텍처 테스트가 0으로 평가되고 빈 커널 본문이 생성되었습니다.
- 수정 사항에서는 HIP 백엔드와 유사하게 최신 아키텍처를 보고하며 MUSA와 호환되지 않는 NVIDIA 전용 기능을 명시적으로 제외합니다.
- `CUDA_ARCH`는 이제 CUB의 감지 로직과 nvcc 동작과 일치하도록 디바이스 패스에 대해서만 정의됩니다.
- CUDA 및 MUSA의 호스트 패스에서 매크로가 정의되지 않았으므로 아키텍처 비교에서 중복된 `defined(CUDA_ARCH)` 체크가 제거되었습니다.
이 변경으로 q8_0 -> f16 디쿼랜티제이션 커널 등 아키텍처에 게이트된 커널 본문이 빈 본문으로 확장되는 대신 MUSA 디바이스에 대해 올바르게 컴파일됩니다.