O projeto llama.cpp lançou a versão b10213, introduzindo suporte para quantização de cache de chave-valor rotacionado. Esta atualização está disponível em uma ampla gama de plataformas e aceleradores de hardware.

  • macOS Apple Silicon (arm64) e Intel (x64)
  • iOS via XCFramework
  • Linux Ubuntu x64 e arm64 (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL FP32/FP16)
  • Windows x64 e arm64 (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP)
  • Android arm64 (CPU)
  • openEuler x86 e aarch64 (ACL Graph)

O lançamento inclui binários para o aplicativo principal, bem como um pacote de interface do usuário separado.