Le projet llama.cpp a publié la version b10213, introduisant le support de la quantification du cache clé-valeur rotatif. Cette mise à jour est disponible sur une large gamme de plateformes et d'accélérateurs matériels.

  • macOS Apple Silicon (arm64) et Intel (x64)
  • iOS via XCFramework
  • Linux Ubuntu x64 et arm64 (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL FP32/FP16)
  • Windows x64 et arm64 (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP)
  • Android arm64 (CPU)
  • openEuler x86 et aarch64 (ACL Graph)

La version inclut les binaires de l'application principale ainsi qu'un package d'interface utilisateur séparé.