El proyecto llama.cpp ha lanzado la compilación b11370, que incluye una optimización de CUDA para fusionar expertos compartidos en la arquitectura Mixture of MoE con Cuantización Vectorial (MMVQ). Este cambio es parte del pull request #29184 y también aborda las comprobaciones nulas de búferes y el manejo de argumentos para stride_col_dst.
- Fusiona expertos compartidos en MMVQ para backends de CUDA.
- Añade comprobaciones nulas para los búferes para mejorar la estabilidad.
- Mueve stride_col_dst a los argumentos de fusión.
Esta versión proporciona binarios actualizados para macOS, Linux, Windows, Android e iOS en varios aceleradores de hardware, incluyendo CPU, Vulkan, ROCm, OpenVINO, SYCL y Snapdragon.