Проект llama.cpp выпустил версию b10899, внедряя специфические улучшения производительности в свой бэкенд Vulkan. Обновление сосредоточено на оптимизации матричных операций для семейства моделей Qwen и улучшении общей производительности при малых значениях M.

  • Оптимизирует mul_mat с m=1 путем обмена матрицами A/B во Vulkan.
  • Улучшает производительность для малых размерностей M.
  • Включает поддержку split_k для малых значений M.
  • Настраивает выбор между малым и средним тайлами для coopmat2 в зависимости от M, а не только от N.

Эти изменения направлены на повышение эффективности вывода на оборудовании, совместимом с Vulkan, особенно для моделей, таких как Qwen, которые выигрывают от указанных оптимизаций матриц.