El proyecto llama.cpp lanzó la versión b10702, que incluye una optimización específica para la ruta del producto punto de cuantización Q2_0 en la arquitectura gfx1201 de AMD. Esta actualización amplía la implementación de HIP para usar instrucciones nativas de permutación amdgcn, mejorando el rendimiento para esta configuración de hardware específica.
- Optimiza `vec_dot_q2_0_q8_1` con permutación amdgcn nativa para gfx1201.
- Amplía la optimización de permutación Q2_0 de HIP y elimina las protecciones redundantes de disponibilidad.
- Optimiza el desempaque MMQ Q2_0 de HIP usando instrucciones de permutación nativas.
- Restaura el manejo del índice de mosaico MMQ y etiqueta las protecciones del preprocesador HIP en el código CUDA.
Esta versión proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de CPU, GPU (CUDA, ROCm, Vulkan, OpenCL) y backends especializados como OpenVINO y SYCL.