llama.cpp プロジェクトはバージョン b10950 をリリースし、ggml-cuda バックエンドに重要な更新を導入しました。このリリースは、ネイティブの BFloat16 アクセラレーションを欠くハードウェアとの互換性を、FP32 精度へのフォールバックによって確保します。
- CUDA バックエンドは、Nvidia (>= AMPERE) および AMD (>= RDNA3 または = CDNA) の BF16 ハードウェア アクセラレーションのないデバイスで F32 にフォールバックするようになりました。
- 他のアーキテクチャに適用されていたロジックが NVIDIA GPU にも拡張されました。
- CPU、CUDA、Vulkan、ROCm、OpenVINO、および SYCL バックエンド向けに、macOS、Linux、Windows、Android、openEuler 用のバイナリが提供されています。
この変更により、古いまたは特定の GPU アーキテクチャを持つユーザーは、ハードウェアの互換性エラーに遭遇することなくモデルを実行できます。