El proyecto llama.cpp ha lanzado la versión b10900, que incluye una actualización técnica al backend de Vulkan. Este lanzamiento añade una dependencia de asignación específicamente para habilitar la optimización de fusión topk_moe durante la fase de prefill.

  • El cambio de código principal es la adición de una dependencia de asignación en la implementación de Vulkan para soportar la fusión topk_moe para operaciones de prefill.
  • Se proporcionan binarios para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm 10.0, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm 10.0), Android e iOS.
  • El soporte de KleidiAI para macOS Apple Silicon está desactivado en esta compilación.

Esta actualización proporciona a los usuarios un rendimiento de prefill optimizado en hardware compatible con Vulkan a través de la nueva técnica de fusión habilitada.