El proyecto llama.cpp ha lanzado la versión b10989, que introduce soporte para habilitar operaciones AllReduce dentro del backend de ROCm. Esta actualización forma parte del desarrollo continuo para ampliar la compatibilidad con hardware y las capacidades de computación distribuida para la inferencia de modelos de lenguaje grandes.
- El lanzamiento incluye binarios precompilados para macOS (Apple Silicon e Intel), Linux (Ubuntu x64, arm64, s390x), Windows y Android.
- Las opciones de aceleración GPU se han ampliado para incluir CUDA 12.8/13.3, Vulkan, OpenVINO, SYCL FP32/FP16 y ROCm 10.0 en las plataformas compatibles.
- Se proporcionan compilaciones específicas para las arquitecturas openEuler x86 y aarch64, incluyendo soporte para ACL Graph en procesadores 910b.
- También está disponible un binario de interfaz de usuario independiente junto con los lanzamientos de la biblioteca principal.
Este lanzamiento permite a los usuarios aprovechar las GPUs AMD basadas en ROCm con funcionalidad AllReduce, mientras proporciona binarios actualizados para varios sistemas operativos y aceleradores de hardware.