llama.cppプロジェクトはバージョンb10201をリリースしました。これにはggml-webgpuバックエンドへの重要な改善が含まれています。このアップデートは、長文脈生成中に量子化されたキーバリューキャッシュを処理する際のflash attentionのパフォーマンスを向上させます。

  • ggml-webgpuにおける量子化KVキャッシュのflash attentionベクトル処理の改善。
  • 値の型チェックに関連するバグの修正とコメントの更新。
  • rebasingによって引き起こされたビルドエラーの解決。
  • macOS (Apple Silicon, Intel)、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows (CPU、CUDA 12/13、Vulkan、OpenCL、HIP、OpenVINO、SYCL)、openEuler用のバイナリを提供。

このリリースにより、ユーザーはより長いシーケンス向けの最適化されたアテンションメカニズムの恩恵を受けながら、幅広いハードウェアプラットフォームでllama.cppを実行できるようになります。