llama.cpp プロジェクトは、サーバー コンポーネントへの特定の変更を含むバージョン b10312 をリリースしました。主な変更点は、繁忙なモデルがルーターから削除される問題を解決することです。

  • サーバー:繁忙なモデルの削除を防ぐ(PR #26567)。
  • macOS/iOS:Apple Silicon (arm64) および Intel (x64) 用のバイナリと iOS XCFramework を提供。macOS での KleidiAI サポートは無効化されています。
  • Linux:Ubuntu x64、arm64、および s390x CPU 向けのビルドに加え、Vulkan、ROCm 7.2、OpenVINO、SYCL FP32、および SYCL FP16 バリアントを提供。
  • Android:arm64 CPU ビルドを含む。
  • Windows:x64 および arm64 CPU、OpenCL Adreno、CUDA 12/13、Vulkan、OpenVINO、SYCL、および HIP をサポート。
  • openEuler:x86 (310p、910b ACL Graph) と aarch64 (310p、910b ACL Graph) 向けのビルドが利用可能ですが、標準のプルリクエストは無効化されています。

このリリースにより、サーバー展開においてアクティブなモデルの継続的な可用性が確保され、主要なオペレーティング システムおよびハードウェア アクセラレーター全体で包括的なバイナリが提供されます。