O projeto llama.cpp lançou a versão b10950, introduzindo uma atualização crítica ao seu backend ggml-cuda. Este lançamento garante compatibilidade com hardware que não possui aceleração nativa BFloat16, recorrendo à precisão FP32.

  • O backend CUDA agora recorre a F32 em dispositivos sem aceleração de hardware BF16 para Nvidia (>= AMPERE) e AMD (>= RDNA3 ou = CDNA).
  • A lógica anteriormente aplicada a outras arquiteturas foi estendida também às GPUs NVIDIA.
  • Binários estão disponíveis para macOS, Linux, Windows, Android e openEuler através dos backends CPU, CUDA, Vulkan, ROCm, OpenVINO e SYCL.

Esta alteração permite que usuários com arquiteturas de GPU mais antigas ou específicas executem modelos sem encontrar erros de compatibilidade de hardware.