llama.cpp 프로젝트는 Vulkan 백엔드에 대한 기술 업데이트를 포함하는 버전 b10900을 출시했습니다. 이 릴리스는 prefill 단계 동안 topk_moe 융합 최적화를 활성화하기 위해 할당 종속성을 특별히 추가합니다.
- 주요 코드 변경은 prefill 작업을 위한 topk_moe 융합을 지원하기 위해 Vulkan 구현에 할당 종속성을 추가하는 것입니다.
- macOS(Apple Silicon 및 Intel), Linux(CPU, Vulkan, ROCm 10.0, OpenVINO, SYCL), Windows(CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm 10.0), Android 및 iOS에 대한 바이너리가 제공됩니다.
- 이 빌드에서는 macOS Apple Silicon에 대한 KleidiAI 지원이 비활성화되었습니다.
이 업데이트는 새로 활성화된 융합 기술을 통해 Vulkan 호환 하드웨어에서 최적화된 prefill 성능을 사용자에게 제공합니다.