llama.cppプロジェクトはバージョンb10723をリリースし、Intel Xe-LPグラフィックスハードウェア向けのOpenCL固有の最適化を含んでいます。このアップデートは、量子化カーネルを調整することでテンソル生成(TG)とプリフィル(PP)のパフォーマンス向上に焦点を当てています。

  • Intelデバイスで2倍の活性化再利用を可能にするため、N_DST値を増やすようにQ4_KおよびQ5_K mul_mv操作を調整しました。
  • Intelアーキテクチャ用にQ4_KおよびQ5_K mul_mm操作の8x8タイル構成を実装しました。
  • データ処理をさらに最適化するため、Q4_K mul_mvのN_DSTを8から16に増やしました。

このリリースでは、CUDA、Vulkan、ROCm、SYCLを含むさまざまなバックエンドに対応するmacOS、Linux、Windows、Android、iOS用の更新されたバイナリが提供されています。