Проект llama.cpp выпустил версию b10702, которая включает специфическую оптимизацию пути скалярного произведения квантования Q2_0 для архитектуры AMD gfx1201. Это обновление расширяет реализацию HIP, чтобы использовать нативные инструкции перестановки amdgcn, улучшая производительность для этой конкретной конфигурации оборудования.
- Оптимизирует `vec_dot_q2_0_q8_1` с нативной перестановкой amdgcn для gfx1201.
- Расширяет оптимизацию перестановки Q2_0 в HIP и удаляет избыточные проверки доступности.
- Оптимизирует распаковку MMQ Q2_0 в HIP с использованием нативных инструкций перестановки.
- Восстанавливает обработку индекса тайла MMQ и помечает защитные макросы препроцессора HIP в коде CUDA.
Эт релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для процессоров, графических ускорителей (CUDA, ROCm, Vulkan, OpenCL) и специализированных бэкендов, таких как OpenVINO и SYCL.