Le projet llama.cpp a publié la version b10984, introduisant le support CUDA pour les opérations SUM_ROWS contiguës par ligne. Cette mise à jour organise également le code pour inclure GGML_OP_MEAN afin de gérer les tenseurs contigus par ligne via un noyau partagé.

  • Ajout du support CUDA pour SUM_ROWS contigu par ligne.
  • Organisation du code pour ajouter GGML_OP_MEAN pour les tenseurs contigus par ligne en utilisant un noyau partagé.
  • Inclusion de tests pour les opérations de permutation et de découpage MEAN.
  • Fourniture de binaires pour macOS, Linux, Windows, Android et openEuler via les backends CPU, CUDA, Vulkan, ROCm, OpenVINO et SYCL.

La release assure la compatibilité avec divers accélérateurs matériels et systèmes d'exploitation pour l'inférence locale.