O projeto llama.cpp lançou a compilação b10988, introduzindo alterações no backend do OpenCL especificamente para modelos Mixture of Experts (MoE). A atualização implementa lógica para escolher a multiplicação matricial do especialista MoE com base no tamanho do lote durante a decodificação especulativa e previsão de múltiplos tokens.
- Controlar a operação GEMM q4_0 MoE pré-construída com base na contagem de roteamento.
- Parar de escrever zeros nos slots de ativação MoE preenchidos para melhorar a eficiência.
- Fornecer binários para macOS, Linux, Windows, Android e openEuler através das plataformas CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL e Adreno.