Проект llama.cpp выпустил сборку b10883, включающую значительные обновления бэкенда Vulkan. Основное изменение заключается в использовании спецификационных констант для операций умножения матрица-на-матрицу типа A с целью улучшения компиляции шейдеров и производительности.

  • Использование спецификационной константы для mul mat type_a в шейдерах Vulkan.
  • Консолидация таблиц разделяемой памяти и уменьшение размера за счёт спецификационных констант типов.
  • Восстановление оптимизации coopmat2 q4_k/q5_k и выделение шейдера для исправления регрессии на архитектуре Ampere.
  • Исправление отсутствующего типа Q2_0 в умножении матриц cm2 и адаптация изменений настройки f16 для Intel.
  • Обход ошибки компилятора cm2 путём использования минимального размера разделяемой памяти 8.

Этот релиз предоставляет обновлённые бинарные файлы для macOS, Linux, Windows, Android и openEuler для CPU, GPU и специализированных аппаратных бэкендов.