Выпуск llama.cpp b11265 включает исправление обработки моделей Mixture of Experts (MoE) бэкендом Vulkan. Обновление корректирует, как `mat_mul_id` выбирает тайлы матричного умножения, устраняя проблему производительности, при которой рабочие потоки оставались простаивать во время диспетчеризации.
- Ранее выбор тайлов опирался на общее количество токенов, что было неверно для сеток диспетчеризации MoE, где истинное значение N на рабочую группу соответствует строкам на эксперта.
- На моделях вроде Sarvam 30B с pp128 эта ошибка приводила к тому, что селектор выбирал тайлы для примерно 6 активных строк вместо 128.
- Исправление гарантирует, что все рабочие в группе имеют задачи, устраняя потери времени, которые ранее составляли 55% длительности задания.
Это изменение повышает эффективность вывода для моделей MoE на Vulkan за счет обеспечения правильного распределения нагрузки между рабочими GPU.