El proyecto llama.cpp lanzó la versión b10702, que incluye una optimización específica para la ruta del producto punto de cuantización Q2_0 en la arquitectura gfx1201 de AMD. Esta actualización amplía la implementación de HIP para usar instrucciones nativas de permutación amdgcn, mejorando el rendimiento para esta configuración de hardware específica.

  • Optimiza `vec_dot_q2_0_q8_1` con permutación amdgcn nativa para gfx1201.
  • Amplía la optimización de permutación Q2_0 de HIP y elimina las protecciones redundantes de disponibilidad.
  • Optimiza el desempaque MMQ Q2_0 de HIP usando instrucciones de permutación nativas.
  • Restaura el manejo del índice de mosaico MMQ y etiqueta las protecciones del preprocesador HIP en el código CUDA.

Esta versión proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de CPU, GPU (CUDA, ROCm, Vulkan, OpenCL) y backends especializados como OpenVINO y SYCL.