O projeto llama.cpp lançou a versão b10989, que introduz suporte para habilitar operações AllReduce no backend ROCm. Esta atualização faz parte do desenvolvimento contínuo para expandir a compatibilidade de hardware e as capacidades de computação distribuída para inferência de grandes modelos de linguagem.

  • O lançamento inclui binários pré-compilados para macOS (Apple Silicon e Intel), Linux (Ubuntu x64, arm64, s390x), Windows e Android.
  • As opções de aceleração de GPU foram expandidas para incluir CUDA 12.8/13.3, Vulkan, OpenVINO, SYCL FP32/FP16 e ROCm 10.0 nas plataformas suportadas.
  • Builds específicos são fornecidos para as arquiteturas openEuler x86 e aarch64, incluindo suporte para ACL Graph em processadores 910b.
  • Um binário de UI standalone também está disponível junto com os lançamentos da biblioteca principal.

Este lançamento permite que os usuários aproveitem GPUs AMD baseadas em ROCm com funcionalidade AllReduce, ao mesmo tempo que fornece binários atualizados para vários sistemas operacionais e aceleradores de hardware.