llama.cpp プロジェクトはバージョン b10950 をリリースし、ggml-cuda バックエンドに重要な更新を導入しました。このリリースは、ネイティブの BFloat16 アクセラレーションを欠くハードウェアとの互換性を、FP32 精度へのフォールバックによって確保します。

  • CUDA バックエンドは、Nvidia (>= AMPERE) および AMD (>= RDNA3 または = CDNA) の BF16 ハードウェア アクセラレーションのないデバイスで F32 にフォールバックするようになりました。
  • 他のアーキテクチャに適用されていたロジックが NVIDIA GPU にも拡張されました。
  • CPU、CUDA、Vulkan、ROCm、OpenVINO、および SYCL バックエンド向けに、macOS、Linux、Windows、Android、openEuler 用のバイナリが提供されています。

この変更により、古いまたは特定の GPU アーキテクチャを持つユーザーは、ハードウェアの互換性エラーに遭遇することなくモデルを実行できます。