Проект llama.cpp выпустил версию b11390, которая содержит исправление ошибки памяти CUDA MMQ, возникавшей при значительном превышении количества экспертов над размером микро-батча.

  • Исправлена ошибка памяти в бэкенде CUDA, связанная с обработкой Mixture-of-Experts (MMQ).
  • Предоставлены бинарные файлы для macOS (Apple Silicon и Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android и openEuler.
  • Включена обновленная версия пользовательского интерфейса.

Это обновление обеспечивает стабильность для пользователей, запускающих модели Mixture-of-Experts на оборудовании CUDA, предотвращая конкретную ошибку доступа к памяти.