llama.cpp プロジェクトはビルド b10693 をリリースし、Qualcomm Hexagon NPU のサポートを導入しました。このアップデートにより、利用可能な NPU コアの実行時検出が可能になり、オンデマンドで推論セッションの作成が許可されます。
- Hexagon デバイスの遅延セッション割り当ておよびクリーンアップインターフェースを追加。
- 利用可能な NPU コアの実行時検出を実装。
- 初期化中に存在しないデバイスを早期に拒否するように構成。
- CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA バックエンド向けに、macOS、Linux、Windows、Android、openEuler のバイナリを提供。