El proyecto llama.cpp ha lanzado la versión b11390, que incluye una corrección para un fallo de memoria CUDA MMQ que ocurría cuando el número de expertos era significativamente mayor que el tamaño del micro-lote.

  • Resuelve un fallo de memoria en el backend de CUDA relacionado con el manejo de Mixture-of-Experts (MMQ).
  • Proporciona binarios para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android y openEuler.
  • Incluye una versión actualizada de la interfaz de usuario.

Esta actualización garantiza la estabilidad para los usuarios que ejecutan modelos Mixture-of-Experts en hardware CUDA al prevenir el error específico de acceso a memoria.