Le projet llama.cpp a publié la version b10312, qui inclut une mise à jour spécifique du composant serveur. Le changement principal résout un problème où des modèles chargés étaient évacués du routeur.

  • Serveur : Empêche l'évacuation des modèles chargés (PR #26567).
  • macOS/iOS : Fournit des binaires pour Apple Silicon (arm64) et Intel (x64), ainsi qu'un iOS XCFramework. Le support KleidiAI sur macOS est désactivé.
  • Linux : Propose des builds pour Ubuntu x64, arm64 et s390x, ainsi que les variantes Vulkan, ROCm 7.2, OpenVINO, SYCL FP32 et SYCL FP16.
  • Android : Inclut un build CPU arm64.
  • Windows : Prend en charge les CPUs x64 et arm64, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL et HIP.
  • openEuler : Des builds pour x86 (310p, 910b ACL Graph) et aarch64 (310p, 910b ACL Graph) sont disponibles, tandis que la pull request standard est désactivée.

Cette version assure la disponibilité continue des modèles actifs dans les déploiements serveur et fournit des binaires complets sur les principaux systèmes d'exploitation et accélérateurs matériels.