llama.cpp 프로젝트는 ggml-cuda 백엔드에 중요한 업데이트를 도입한 버전 b10950을 출시했습니다. 이 릴리스는 네이티브 BFloat16 가속이 없는 하드웨어와의 호환성을 FP32 정밀도로 폴백하여 보장합니다.

  • CUDA 백엔드는 이제 Nvidia (>= AMPERE) 및 AMD (>= RDNA3 또는 = CDNA)의 BF16 하드웨어 가속이 없는 장치에서 F32로 폴백합니다.
  • 이전 다른 아키텍처에 적용된 로직이 NVIDIA GPU로도 확장되었습니다.
  • CPU, CUDA, Vulkan, ROCm, OpenVINO 및 SYCL 백엔드를 위해 macOS, Linux, Windows, Android 및 openEuler용 바이너리가 제공됩니다.

이 변경으로 오래되거나 특정 GPU 아키텍처를 가진 사용자는 하드웨어 호환성 오류 없이 모델을 실행할 수 있습니다.