Проект llama.cpp выпустил версию b10984, добавляющую поддержку CUDA для операций SUM_ROWS с непрерывным расположением строк. Это обновление также организует код для включения GGML_OP_MEAN для обработки тензоров с непрерывным расположением строк через общее ядро.
- Добавлена поддержка CUDA для SUM_ROWS с непрерывным расположением строк.
- Код организован для добавления GGML_OP_MEAN для тензоров с непрерывным расположением строк с использованием общего ядра.
- Включены тесты для операций перемешивания и среза MEAN.
- Предоставлены бинарные файлы для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, CUDA, Vulkan, ROCm, OpenVINO и SYCL.
Релиз обеспечивает совместимость с различными аппаратными ускорителями и операционными системами для локального вывода.