Проект llama.cpp выпустил версию b11195, внедряя реализацию блочного умножения матриц для k-quants в бэкенде CPU. Это изменение распаковывает квантованные данные в тайлы int8 размером 256x256 и вычисляет результаты с использованием микроядер для повышения производительности при выполнении крупных матричных операций.

  • Tiled mul_mat обеспечивает ускорение в 3-6 раз для больших матричных умножений, точка пересечения достигается на размерах 4096x64 * 64x4096.
  • Ошибки остаются незначительными: максимальные ошибки около 1-e04, а RMSE — около 1-e05.
  • В релиз включены исправления для сборок ARM и Windows, унифицированная поддержка IQP для бенчмарков Q5_K и IQ4_XS, а также оптимизированные ядра AVX2.

Обновление повышает скорость вывода при выполнении крупных матричных операций, сохраняя численную точность на поддерживаемых платформах.