Le projet llama.cpp a publié la version b10989, qui introduit le support de l'activation des opérations AllReduce dans le backend ROCm. Cette mise à jour s'inscrit dans le développement continu visant à étendre la compatibilité matérielle et les capacités de calcul distribué pour l'inférence de grands modèles de langage.

  • La version inclut des binaires préconstruits pour macOS (Apple Silicon et Intel), Linux (Ubuntu x64, arm64, s390x), Windows et Android.
  • Les options d'accélération GPU sont élargies pour inclure CUDA 12.8/13.3, Vulkan, OpenVINO, SYCL FP32/FP16 et ROCm 10.0 sur les plateformes prises en charge.
  • Des builds spécifiques sont fournis pour les architectures openEuler x86 et aarch64, incluant le support d'ACL Graph sur les processeurs 910b.
  • Un binaire d'interface utilisateur autonome est également disponible aux côtés des versions de la bibliothèque principale.

Cette version permet aux utilisateurs de tirer parti des GPU AMD basés sur ROCm avec la fonctionnalité AllReduce tout en fournissant des binaires mis à jour pour divers systèmes d'exploitation et accélérateurs matériels.