Le projet llama.cpp a publié la version b10950, introduisant une mise à jour critique de son backend ggml-cuda. Cette release assure la compatibilité avec le matériel dépourvu d'accélération native BFloat16 en recourant à la précision FP32.

  • Le backend CUDA bascule désormais vers F32 sur les appareils sans accélération matérielle BF16 pour Nvidia (>= AMPERE) et AMD (>= RDNA3 ou = CDNA).
  • La logique précédemment appliquée aux autres architectures a été étendue aux GPU NVIDIA.
  • Des binaires sont fournis pour macOS, Linux, Windows, Android et openEuler via les backends CPU, CUDA, Vulkan, ROCm, OpenVINO et SYCL.

Ce changement permet aux utilisateurs disposant d'architectures GPU plus anciennes ou spécifiques d'exécuter des modèles sans rencontrer d'erreurs de compatibilité matérielle.