llama.cpp 프로젝트는 SYCL 백엔드 내에서 IQ3_S multi-column MMVQ 양자화 형식에 대한 지원을 도입한 버전 b11460을 출시했습니다. 이 업데이트는 표준 CPU 및 GPU 가속 옵션과 함께 새 빌드에 포함되어 있습니다.
- 릴리스는 pull request #29500을 통해 SYCL 구현에 IQ3_S multi-column MMVQ 지원을 추가합니다.
- macOS(Apple Silicon 및 Intel), Linux(x64, arm64, s390x), Windows, Android 및 openEuler에 대한 바이너리가 제공됩니다.
- GPU 가속은 지원되는 플랫폼에서 CUDA 12/13, Vulkan, ROCm 10.0, OpenVINO 및 OpenCL Adreno를 통해 사용할 수 있습니다.
- Linux 및 Android의 Snapdragon 장치용 특정 빌드가 포함되어 있으며 CPU, Adreno GPU 및 Hexagon NPU를 지원합니다.
이 릴리스를 통해 사용자는 최신 SYCL 최적화에 액세스할 수 있으며 다양한 아키텍처에서 llama.cpp 모델을 실행하기 위한 하드웨어 호환성이 확대됩니다.