El proyecto llama.cpp lanzó la compilación b10988, introduciendo cambios en el backend de OpenCL específicamente para modelos Mixture of Experts (MoE). La actualización implementa lógica para elegir la multiplicación matricial del experto MoE basada en el tamaño del lote durante la descodificación especulativa y la predicción de múltiples tokens.
- Enmascarar la operación GEMM q4_0 MoE preconstruida según el recuento de enrutamiento.
- Dejar de escribir ceros en las ranuras de activación MoE rellenas para mejorar la eficiencia.
- Proporcionar binarios para macOS, Linux, Windows, Android y openEuler a través de plataformas CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL y Adreno.