llama.cpp 프로젝트는 혼합 전문가 모델을 위한 새로운 OpenCL 바이너리 커널을 도입하는 버전 b10657을 출시했습니다. 구체적으로, 이 업데이트는 호환되는 하드웨어에서 효율적인 계산을 지원하기 위해 `kernel_gemm_moe_q4_0_q8_1_dp4a_bin` 및 `kernel_gemm_moe_mxfp4_q8_1_dp4a_bin`을 추가합니다.

  • q4_0/q8_1 및 mxfp4/q8_1 양자화에 대한 GEMO MOE용 OpenCL 바이너리 커널 추가.
  • macOS (Apple Silicon 및 Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android 및 openEuler용 바이너리 제공.
  • 이 릴리스에서 macOS Apple Silicon의 KleidiAI 지원은 비활성화된 상태로 유지됩니다.

이 업데이트는 특정 OpenCL 커널 구현을 활성화하여 혼합 전문가 모델의 하드웨어 호환성을 확장합니다.