llama.cpp プロジェクトはビルド b11207 をリリースし、Hexagon バックエンドで Q4_0 と Q8_0 の GET_ROWS 操作のタイルサポートを導入しました。このアップデートには、マクロ、レジスタスパイル、DMA パイプラインの修正に加え、カーネル選択ロジックの改善とベクトル化の再有効化が含まれています。

  • タイル化された HVX デ量子化を使用して、Hexagon 向けに Q4_0 および Q8_0 GET_ROWS のタイルサポートを追加しました。
  • サポートされていない操作のチェックをクリーンアップしながら、hex-get-rows 内のマクロとレジスタスパイルを修正しました。
  • DMA パイプラインを改善し、カーネル選択ロジックを簡素化しました。
  • サンプラーの更新中に回帰が検出された後、ベクトライザーを再有効化しました。

このリリースでは、CPU、GPU、NPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL を含むさまざまなハードウェアバックエンド向けに、macOS、Linux、Windows、Android、openEuler 用のバイナリが提供されています。