Проект llama.cpp выпустил версию b10726, которая вносит значительные оптимизации производительности для обработки больших размеров пакетов в IQ-квантованных моделях. Основное обновление использует инструкции AVX2 для ускорения сеточных IQ-квантований через пакетные операции GEMM.
- Пакетная реализация GEMM для сеточных IQ-квантований
- Векторизация декодирования IQ-панелей с пониженным порогом для ускорения
- Внедрение ядра ggml_gemm_iqp_8x8_q8_K_p4 и удаление буфера gather
- Единая схема layout для gather, смещение затвора и векторизованное чередование для IQ-панелей
- Добавление поддержки NUMA fallback и тестов пакетов на 10 строк для покрытия IQP
Это обновление предоставляет пользователям более быструю возможность вывода (инференса) при запуске IQ-моделей на совместимом оборудовании.