Проект llama.cpp выпустил сборку b10181, которая включает исправление в ggml-cuda для отключения квантования матричного умножения (MMQ) на GPU с менее чем 48 КиБ разделяемой памяти на блок. Ранее конфигурации MMQ предполагали минимальный объем в 48 КиБ, что приводило к фатальным ошибкам на устройствах, таких как NVIDIA Pascal и Moore Threads MTT S70, где размер тайла превышал доступную память.
- Исправление добавляет проверку в `ggml_cuda_should_use_mmq()` для оценки бюджета разделяемой памяти перед выбором тайлов MMQ.
- Устройства с недостаточным объемом памяти теперь переходят на путь BLAS во время префилла, избегая аварийных завершений работы при сохранении производительности генерации токенов.
- Это изменение применяется к любому устройству CUDA, сообщающему о менее чем 48 КиБ разделяемой памяти на блок, а не только к определенным устройствам MUSA QY1.
Это обновление предотвращает сбои на старом или специализированном оборудовании с ограниченной разделяемой памятью, обеспечивая стабильный вывод за счет автоматического использования совместимого бэкенда BLAS.