Проект llama.cpp выпустил сборку b11370, которая включает оптимизацию CUDA для объединения общих экспертных модулей в архитектуру Смешивания MoE с Векторной Квантованием (MMVQ). Это изменение является частью pull request #29184 и также решает вопросы проверки буферов на null и обработки аргументов для stride_col_dst.
- Объединяет общие экспертные модули в MMVQ для бэкендов CUDA.
- Добавляет проверки на null для буферов для повышения стабильности.
- Перемещает stride_col_dst в аргументы слияния.
Это обновление предоставляет новые двоичные файлы для macOS, Linux, Windows, Android и iOS для различных аппаратных ускорителей, включая CPU, Vulkan, ROCm, OpenVINO, SYCL и Snapdragon.