Проект llama.cpp выпустил версию b10908, которая включает исправление для простаивающих потоков в оставшихся ядрах iq mul_mv для ne00 < 1024. Это изменение обобщает логику разделения строк для шести конкретных ядер: iq1_s, iq1_m, iq2_xxs, iq2_xs, iq2_s и iq3_s.

  • Исправление решает случаи, когда строки содержат менее 32 чанков, позволяя потокам совместно использовать чанки и брать срезы строк.
  • Оно смещает указатель строки src0 один раз в ядрах iq mul_mv, поскольку q2, dh, sc, qh и знаки выводятся из xr.
  • Реализация объединяет разделение строк iq mul_mv с offset0, чтобы сохранить x и его производные указатели на существующем пути.

Этот релиз предоставляет бинарные файлы для macOS, Linux, Android, Windows и openEuler для различных архитектур, включая CPU, CUDA, ROCm, Vulkan и SYCL.