Проект llama.cpp выпустил сборку b10714, включающую специфические оптимизации для бэкенда Vulkan, ориентированные на оборудование AMD Strix Halo. Обновление корректирует количество строк умножения матрицы на вектор для улучшения производительности при пакетном выводе.

  • Vulkan: Устанавливает статичные 4 строки для операций mat-vec на архитектурах RDNA3 с более чем четырьмя столбцами, поскольку эта конфигурация показывает лучшие результаты бенчмарков, чем по умолчанию.
  • Vulkan: Применяет статичную настройку в 4 строки для mul_mat_vec_id на машинах Strix Halo, демонстрируя более высокую скорость в различных типах и размерах пакетов по сравнению с настройками по умолчанию.

Эти изменения обеспечивают ощутимый прирост производительности для пользователей, запускающих llama.cpp на GPU на базе RDNA3, таких как Strix Halo.