O projeto llama.cpp lançou a versão b10900, que inclui uma atualização técnica no backend Vulkan. Este lançamento adiciona uma dependência de alocação especificamente para habilitar a otimização de fusão topk_moe durante a fase de prefill.

  • A principal alteração de código é a adição de uma dependência de alocação na implementação do Vulkan para suportar a fusão topk_moe para operações de prefill.
  • Binários estão disponíveis para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm 10.0, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm 10.0), Android e iOS.
  • O suporte do KleidiAI para macOS Apple Silicon está desativado nesta compilação.

Esta atualização fornece aos usuários desempenho de prefill otimizado em hardware compatível com Vulkan por meio da técnica de fusão recém-habilitada.