Проект llama.cpp выпустил версию b10427, включающую оптимизацию производительности для видеокарт Intel Arc с помощью SYCL. Обновление реализует объединение операций gate, up и GLU в плотном слое прямой связи (FFN) q4_K.
- Измерено на Arc Pro B70 с помощью llama-bench: пропускная способность увеличилась на 2,8% для qwen2.5-3B-Instruct и на 2,0% для gemma-2-2b-it.
- Бенчмарки пакетного вывода на модели qwen2.5-3B показали значительный прирост: +3,4% при размере пакета 1, до +10,1% при B=2, +10,7% при B=4 и +12,4% при B=8.
В этом релизе предоставлены предварительно скомпилированные двоичные файлы для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, CUDA, Vulkan, ROCm и OpenVINO.