O projeto llama.cpp lançou a versão b10657, introduzindo novos kernels binários OpenCL para modelos de especialistas mistos. Especificamente, a atualização adiciona `kernel_gemm_moe_q4_0_q8_1_dp4a_bin` e `kernel_gemm_moe_mxfp4_q8_1_dp4a_bin` para suportar computação eficiente em hardware compatível.

  • Adicionados kernels binários OpenCL para GEMO MOE com quantizações q4_0/q8_1 e mxfp4/q8_1.
  • Fornecidos binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android e openEuler.
  • O suporte ao KleidiAI no Apple Silicon do macOS permanece desativado nesta versão.

Esta atualização expande a compatibilidade de hardware para modelos de especialistas mistos habilitando implementações específicas de kernels OpenCL.