O projeto llama.cpp lançou a compilação b10756, que modifica o comportamento do backend do Vulkan para solicitar apenas a extensão VK_KHR_shader_bfloat16 quando ela é suportada pelo hardware.

Esta atualização aborda problemas de compatibilidade onde solicitar extensões não suportadas poderia causar falhas em certas GPUs. O lançamento inclui binários para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL), Android e iOS.

A alteração garante que a inferência baseada em Vulkan funcione corretamente em dispositivos que não suportam a extensão de shader bfloat16.