Proyek llama.cpp telah merilis versi b10989, yang memperkenalkan dukungan untuk mengaktifkan operasi AllReduce di dalam backend ROCm. Pembaruan ini merupakan bagian dari pengembangan berkelanjutan untuk memperluas kompatibilitas perangkat keras dan kemampuan komputasi terdistribusi untuk inferensi model bahasa besar.

  • Rilis ini mencakup binari pra-dibangun untuk macOS (Apple Silicon dan Intel), Linux (Ubuntu x64, arm64, s390x), Windows, dan Android.
  • Opsi akselerasi GPU diperluas untuk mencakup CUDA 12.8/13.3, Vulkan, OpenVINO, SYCL FP32/FP16, dan ROCm 10.0 di berbagai platform yang didukung.
  • Build khusus disediakan untuk arsitektur openEuler x86 dan aarch64, termasuk dukungan untuk ACL Graph pada prosesor 910b.
  • Binari UI mandiri juga tersedia bersama dengan rilis pustaka inti.

Rilis ini memungkinkan pengguna memanfaatkan GPU AMD berbasis ROCm dengan fungsionalitas AllReduce sambil menyediakan binari yang diperbarui untuk berbagai sistem operasi dan akselerator perangkat keras.