llama.cpp プロジェクトはバージョン b10336 をリリースしました。これには、ggml-webgpu コンポーネント内の複数の wgsl ファイルのリファクタリングと flash_attn wgsl の簡素化が含まれています。

このアップデートでは、macOS (Apple Silicon および Intel)、iOS、Linux (CPU、Vulkan、ROCm 7.2、OpenVINO、SYCL 付き Ubuntu)、Android、Windows (CPU、OpenCL、CUDA 12/13、Vulkan、OpenVINO、SYCL、HIP)、および openEuler プラットフォーム用のバイナリが提供されます。

リリースには、ユーザーがモデル推論エンジンと対話するための標準的な UI ビルドも含まれています。