llama.cpp バージョン b9703 には、サーバーのプリセット処理のリワークが含まれており、リモート HF プリセットのサポートと非推奨の関数が削除されました。このリリースでは、macOS、Linux、Android、Windows、openEuler 向けのバイナリが提供されており、Vulkan、CUDA、OpenVINO、SYCL を含む複数のアーキテクチャとハードウェアアクセラレーションオプションに対応しています。
llama.cpp b9703 リリース:更新とバイナリダウンロード
llama.cpp リリース b9741 が新しいバイナリとサポートを追加
llama.cpp バージョン b9741 は、macOS、Linux、Android、Windows、openEuler 向けに複数のアーキテクチャに対応した新しいバイナリを導入しました。このリリースには Vulkan、CUDA 12.4 および 13.3、OpenVINO、SYCL、ROCm のサポートが含まれ、iOS と Ubuntu のバージョンも更新されました。
ggmlがAMXの最適化にパーティション平坦化を採用
ggmlプロジェクトは、n_batch * M に対するパーティションを平坦化することでAMXのパフォーマンスを最適化し、すべてのスレッドが量子化に参加するようにしました。この変更により、CPUおよびGPUプラットフォーム上で様々なモデルやハードウェア構成において最大1.47倍の速度向上を実現し、推論時間の改善が一貫して確認されています。
ggml-webgpu が Vulkan および NVIDIA 用の F16 アダプター トグルを追加
ggml-webgpu プロジェクトは、Vulkan および NVIDIA GPU のハーフ精度 (F16) サポート用アダプター トグルを追加しました。このアップデートにより、macOS、Linux、Android、Windows、openEuler を含む複数のプラットフォームで互換性のあるハードウェアのパフォーマンスが向上し、ARM および x64 アーキテクチャ用の特定のビルドも提供されています。
LLaMA.cpp b9729 リリース:新しいバイナリとプラットフォームサポート
LLaMA.cpp は、macOS、Linux、Android、Windows、openEuler 向けのバイナリを複数のアーキテクチャでリリースしました。今回のリリースには、CPU、Vulkan、OpenVINO、SYCL、ROCm のサポートが含まれ、新しい UI パッケージも追加されました。内部の 'webui' への参照は削除されました。
Metalバックエンドがconcat演算子に対してf16およびbf16サポートを追加
llama.cppのMetalバックエンドは、既存のf32およびi32サポートに加え、concat演算子に対するf16およびbf16テンソル型のサポートをサポートするように拡張されました。このアップデートには、専用のカーネルテンプレート、更新されたパイプラインゲッター、改善された型ベースのカーネルディスパッチが含まれており、pi:llama.cpp/Qwen3.6-27Bの支援を受けています。