O projeto llama.cpp lançou a versão b10702, que inclui uma otimização específica para o caminho do produto interno da quantização Q2_0 na arquitetura gfx1201 da AMD. Esta atualização amplia a implementação do HIP para usar instruções nativas de permutação amdgcn, melhorando o desempenho para esta configuração de hardware específica.
- Otimiza `vec_dot_q2_0_q8_1` com permutação amdgcn nativa para gfx1201.
- Amplia a otimização de permutação Q2_0 do HIP e remove proteções redundantes de disponibilidade.
- Otimiza o desempacotamento MMQ Q2_0 do HIP usando instruções de permutação nativas.
- Restaura o tratamento do índice de bloco MMQ e rotula as proteções do pré-processador HIP no código CUDA.
Este lançamento fornece binários para macOS, Linux, Windows, Android e openEuler através de CPU, GPU (CUDA, ROCm, Vulkan, OpenCL) e backends especializados como OpenVINO e SYCL.