Проект llama.cpp выпустил сборку b11370, которая включает оптимизацию CUDA для объединения общих экспертных модулей в архитектуру Смешивания MoE с Векторной Квантованием (MMVQ). Это изменение является частью pull request #29184 и также решает вопросы проверки буферов на null и обработки аргументов для stride_col_dst.

  • Объединяет общие экспертные модули в MMVQ для бэкендов CUDA.
  • Добавляет проверки на null для буферов для повышения стабильности.
  • Перемещает stride_col_dst в аргументы слияния.

Это обновление предоставляет новые двоичные файлы для macOS, Linux, Windows, Android и iOS для различных аппаратных ускорителей, включая CPU, Vulkan, ROCm, OpenVINO, SYCL и Snapdragon.