llama.cpp プロジェクトはビルド b10693 をリリースし、Qualcomm Hexagon NPU のサポートを導入しました。このアップデートにより、利用可能な NPU コアの実行時検出が可能になり、オンデマンドで推論セッションの作成が許可されます。

  • Hexagon デバイスの遅延セッション割り当ておよびクリーンアップインターフェースを追加。
  • 利用可能な NPU コアの実行時検出を実装。
  • 初期化中に存在しないデバイスを早期に拒否するように構成。
  • CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA バックエンド向けに、macOS、Linux、Windows、Android、openEuler のバイナリを提供。