llama.cpp プロジェクトはバージョン b10739 をリリースしました。これには Apple の M2 Max ハードウェア向けの特定の性能最適化が含まれています。このアップデートでは、M2 Max の 30 個の GPU コアに合わせた高速注意ベクトル (fa-vec) 調整が導入されました。

  • f16 および q8_0 dtypes で ggml-metal-tuning を使用して収集した M2 Max 用の fa-vec 調整行を追加しました。
  • macOS Apple Silicon、Intel Macs、iOS、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Windows(CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)、Android、openEuler 用のバイナリを提供しました。

このリリースは、最新の Apple silicon で最適化された推論パフォーマンスを保証しつつ、さまざまなオペレーティングシステムとハードウェアアクセラレーターにわたる広範なサポートを維持します。