Le projet llama.cpp a publié la version b10900, qui comprend une mise à jour technique du backend Vulkan. Cette release ajoute une dépendance d'allocation spécifiquement pour activer l'optimisation de fusion topk_moe pendant la phase de préremplissage.

  • Le changement de code principal est l'ajout d'une dépendance d'allocation dans l'implémentation de Vulkan pour prendre en charge la fusion topk_moe pour les opérations de préremplissage.
  • Des binaires sont fournis pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, ROCm 10.0, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm 10.0), Android et iOS.
  • Le support KleidiAI pour macOS Apple Silicon est désactivé dans cette compilation.

Cette mise à jour offre aux utilisateurs des performances de préremplissage optimisées sur du matériel compatible Vulkan grâce à la technique de fusion nouvellement activée.