llama.cpp 프로젝트는 Mixture of Experts (MoE) 모델을 위해 OpenCL 백엔드에 변경 사항을 도입하는 빌드 b10988을 출시했습니다. 이 업데이트는 추론 디코딩 및 다중 토큰 예측 동안 배치 크기에 기반하여 MoE 전문가 행렬 곱을 선택하는 로직을 구현합니다.

  • 라우팅 수에 따라 사전 구축된 q4_0 MoE GEMM 연산을 게이트합니다.
  • 효율성을 높이기 위해 패딩된 MoE 활성화 슬롯에 0을 쓰는 것을 중단합니다.
  • CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL 및 Adreno 플랫폼을 위한 macOS, Linux, Windows, Android 및 openEuler용 바이너리를 제공합니다.