El proyecto llama.cpp lanzó la versión b10718, que incluye una actualización significativa en su backend CUDA. El cambio más notable es la extensión de la fusión Mixture of Experts (MOE) para admitir la decodificación especulativa (specdec), abordando limitaciones anteriores donde la fusión MOE glu y topk-router estaba restringida a procesar solo un token a la vez.
- CUDA: Se extendió la fusión MOE a specdec, eliminando la restricción de un solo token para las fusiones anteriores de MOE glu y topk-router.
- Se agregó soporte para el caso SWIGLU_CLAMP en la implementación de fusión MOE multi-token.
- Se abordaron los comentarios de revisión del pull request #27621.
Esta actualización mejora el rendimiento de los modelos que utilizan decodificación especulativa al habilitar operaciones fusionadas más eficientes en las GPU NVIDIA.