Проект llama.cpp выпустил версию b10984, добавляющую поддержку CUDA для операций SUM_ROWS с непрерывным расположением строк. Это обновление также организует код для включения GGML_OP_MEAN для обработки тензоров с непрерывным расположением строк через общее ядро.

  • Добавлена поддержка CUDA для SUM_ROWS с непрерывным расположением строк.
  • Код организован для добавления GGML_OP_MEAN для тензоров с непрерывным расположением строк с использованием общего ядра.
  • Включены тесты для операций перемешивания и среза MEAN.
  • Предоставлены бинарные файлы для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, CUDA, Vulkan, ROCm, OpenVINO и SYCL.

Релиз обеспечивает совместимость с различными аппаратными ускорителями и операционными системами для локального вывода.