O projeto llama.cpp lançou a compilação b10988, introduzindo alterações no backend do OpenCL especificamente para modelos Mixture of Experts (MoE). A atualização implementa lógica para escolher a multiplicação matricial do especialista MoE com base no tamanho do lote durante a decodificação especulativa e previsão de múltiplos tokens.

  • Controlar a operação GEMM q4_0 MoE pré-construída com base na contagem de roteamento.
  • Parar de escrever zeros nos slots de ativação MoE preenchidos para melhorar a eficiência.
  • Fornecer binários para macOS, Linux, Windows, Android e openEuler através das plataformas CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL e Adreno.