Проект llama.cpp выпустил сборку b10871, вводящую выделенный шейдер mul_mat_vec_iq4_xs для пути dmmv в Vulkan. Это изменение заменяет предыдущую универсальную реализацию по умолчанию, чтобы повысить производительность на оборудовании RDNA4.

  • Новый шейдер обеспечивает примерно на 6-17% более быструю генерацию токенов в зависимости от используемой модели.
  • Экспериментальная ветка, пытавшаяся полностью развернуть цикл блока для n_it <= 8, была удалена, так как она функционально эквивалентна простому циклу, оставшемуся в коде.
  • Бинарные файлы доступны для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, CUDA, ROCm, OpenVINO, SYCL и Vulkan.