Проект llama.cpp выпустил версию b10726, которая вносит значительные оптимизации производительности для обработки больших размеров пакетов в IQ-квантованных моделях. Основное обновление использует инструкции AVX2 для ускорения сеточных IQ-квантований через пакетные операции GEMM.

  • Пакетная реализация GEMM для сеточных IQ-квантований
  • Векторизация декодирования IQ-панелей с пониженным порогом для ускорения
  • Внедрение ядра ggml_gemm_iqp_8x8_q8_K_p4 и удаление буфера gather
  • Единая схема layout для gather, смещение затвора и векторизованное чередование для IQ-панелей
  • Добавление поддержки NUMA fallback и тестов пакетов на 10 строк для покрытия IQP

Это обновление предоставляет пользователям более быструю возможность вывода (инференса) при запуске IQ-моделей на совместимом оборудовании.