llama.cpp プロジェクトはバージョン b10984 をリリースし、行連続の SUM_ROWS 操作に対する CUDA サポートを導入しました。このアップデートでは、共有カーネルを通じて行連続テンソルを処理するために GGML_OP_MEAN を含むようにコードが整理されました。
- 行連続の SUM_ROWS に対する CUDA サポートを追加。
- 共有カーネルを使用して行連続テンソル用の GGML_OP_MEAN を追加するためにコードを整理。
- MEAN の置換およびスライス操作のテストを含める。
- CPU、CUDA、Vulkan、ROCm、OpenVINO、および SYCL バックエンド across macOS、Linux、Windows、Android、および openEuler 用のバイナリを提供。
このリリースは、ローカル推論のためにさまざまなハードウェアアクセラレータとオペレーティングシステムとの互換性を確保します。