Le projet llama.cpp a publié la compilation b10756, qui modifie le comportement du backend Vulkan pour ne demander l'extension VK_KHR_shader_bfloat16 que lorsqu'elle est prise en charge par le matériel.

Cette mise à jour résout des problèmes de compatibilité où la demande d'extensions non prises en charge pouvait entraîner des échecs sur certains GPU. La version inclut des binaires pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL), Android et iOS.

Le changement garantit que l'inférence basée sur Vulkan fonctionne correctement sur les appareils qui ne prennent pas en charge l'extension de shader bfloat16.