Proyek llama.cpp merilis versi b10950, memperkenalkan pembaruan kritis pada backend ggml-cuda-nya. Rilis ini memastikan kompatibilitas dengan perangkat yang tidak memiliki akselerasi BFloat16 native dengan fallback ke presisi FP32.

  • Backend CUDA sekarang fallback ke F32 pada perangkat tanpa akselerasi hardware BF16 untuk Nvidia (>= AMPERE) dan AMD (>= RDNA3 atau = CDNA).
  • Logika yang sebelumnya diterapkan pada arsitektur lain juga diperluas ke GPU NVIDIA.
  • Binari disediakan untuk macOS, Linux, Windows, Android, dan openEuler melalui backend CPU, CUDA, Vulkan, ROCm, OpenVINO, dan SYCL.

Perubahan ini memungkinkan pengguna dengan arsitektur GPU lama atau spesifik untuk menjalankan model tanpa mengalami kesalahan kompatibilitas perangkat keras.