Le projet llama.cpp a publié la version b10727, qui introduit le support de la concaténation pour les types de données quantifiés. Cette mise à jour est assistée par DeepSeek-V4-Flash-0731 et inclut des binaires pour macOS, Linux, Windows, Android et openEuler sur divers backends matériels incluant CPU, CUDA, ROCm et Vulkan.

La version fournit des binaires précompilés pour plusieurs plateformes et architectures :

  • macOS Apple Silicon (arm64) et Intel (x64)
  • iOS via XCFramework
  • Distributions Linux incluant Ubuntu x64, arm64, s390x et variantes avec support Vulkan, ROCm 7.14, OpenVINO et SYCL
  • Windows x64 et arm64 avec options CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL et ROCm 7.14
  • Android arm64 (CPU)
  • Configurations openEuler x86 et aarch64

Cette version permet aux utilisateurs d'utiliser la nouvelle fonctionnalité de concaténation quantifiée sur une large gamme de systèmes d'exploitation pris en charge et d'accélérateurs matériels.