llama.cpp 프로젝트는 b11403 버전을 출시했으며, 여기에는 작은 배치 크기에서 얇은 f16 및 bf16 행렬 곱셈에 MMVF 커널을 사용하기 위한 CUDA 최적화가 포함되어 있습니다.
- NVIDIA GPU에서 성능 개선을 위해 커널 선택 논리를 조정했습니다.
- macOS (Apple Silicon 및 Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android 및 openEuler용 바이너리를 제공했습니다.
- 표준 바이너리와 함께 iOS XCFramework 및 UI 빌드를 포함했습니다.