El proyecto llama.cpp lanzó la versión b10950, introduciendo una actualización crítica a su backend ggml-cuda. Este lanzamiento asegura la compatibilidad con hardware que carece de aceleración nativa BFloat16 al recurrir a la precisión FP32.
- El backend CUDA ahora recurre a F32 en dispositivos sin aceleración de hardware BF16 para Nvidia (>= AMPERE) y AMD (>= RDNA3 o = CDNA).
- La lógica previamente aplicada a otras arquitecturas se extendió también a las GPU NVIDIA.
- Se proporcionan binarios para macOS, Linux, Windows, Android y openEuler a través de los backends CPU, CUDA, Vulkan, ROCm, OpenVINO y SYCL.
Este cambio permite a los usuarios con arquitecturas de GPU antiguas o específicas ejecutar modelos sin encontrar errores de compatibilidad de hardware.