Проект llama.cpp выпустил версию b10899, внедряя специфические улучшения производительности в свой бэкенд Vulkan. Обновление сосредоточено на оптимизации матричных операций для семейства моделей Qwen и улучшении общей производительности при малых значениях M.
- Оптимизирует mul_mat с m=1 путем обмена матрицами A/B во Vulkan.
- Улучшает производительность для малых размерностей M.
- Включает поддержку split_k для малых значений M.
- Настраивает выбор между малым и средним тайлами для coopmat2 в зависимости от M, а не только от N.
Эти изменения направлены на повышение эффективности вывода на оборудовании, совместимом с Vulkan, особенно для моделей, таких как Qwen, которые выигрывают от указанных оптимизаций матриц.