O projeto llama.cpp lançou a versão b11012, que introduz suporte a Vulkan para operações hc do qwen4exp por meio do pull request #28988. Esta atualização também inclui uma correção para um comentário desatualizado.

A versão fornece binários e frameworks em várias plataformas e aceleradores de hardware:

  • macOS: Apple Silicon (arm64), Intel (x64) e iOS XCFramework.
  • Linux: compilações do Ubuntu para CPU, Vulkan, CUDA 12/13, ROCm 10.0, OpenVINO e SYCL.
  • Windows: compilações para CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL e ROCm 10.0.
  • Android: suporte a CPU arm64.

Esta versão permite que os usuários executem modelos qwen4exp com operações de alto processamento em GPUs compatíveis com Vulkan em sistemas operacionais suportados.