Выпуск llama.cpp b11265 включает исправление обработки моделей Mixture of Experts (MoE) бэкендом Vulkan. Обновление корректирует, как `mat_mul_id` выбирает тайлы матричного умножения, устраняя проблему производительности, при которой рабочие потоки оставались простаивать во время диспетчеризации.

  • Ранее выбор тайлов опирался на общее количество токенов, что было неверно для сеток диспетчеризации MoE, где истинное значение N на рабочую группу соответствует строкам на эксперта.
  • На моделях вроде Sarvam 30B с pp128 эта ошибка приводила к тому, что селектор выбирал тайлы для примерно 6 активных строк вместо 128.
  • Исправление гарантирует, что все рабочие в группе имеют задачи, устраняя потери времени, которые ранее составляли 55% длительности задания.

Это изменение повышает эффективность вывода для моделей MoE на Vulkan за счет обеспечения правильного распределения нагрузки между рабочими GPU.