Le projet llama.cpp a publié la version b11012, qui introduit le support Vulkan pour les opérations hc de qwen4exp via la demande de tirage #28988. Cette mise à jour comprend également une correction pour un commentaire obsolète.

La publication fournit des binaires et des frameworks sur plusieurs plateformes et accélérateurs matériels :

  • macOS : Apple Silicon (arm64), Intel (x64) et iOS XCFramework.
  • Linux : compilations Ubuntu pour CPU, Vulkan, CUDA 12/13, ROCm 10.0, OpenVINO et SYCL.
  • Windows : compilations pour CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL et ROCm 10.0.
  • Android : support CPU arm64.

Cette publication permet aux utilisateurs d'exécuter des modèles qwen4exp avec des opérations à forte charge de calcul sur des GPU compatibles Vulkan sur les systèmes d'exploitation pris en charge.