O projeto llama.cpp lançou a versão b10702, que inclui uma otimização específica para o caminho do produto interno da quantização Q2_0 na arquitetura gfx1201 da AMD. Esta atualização amplia a implementação do HIP para usar instruções nativas de permutação amdgcn, melhorando o desempenho para esta configuração de hardware específica.

  • Otimiza `vec_dot_q2_0_q8_1` com permutação amdgcn nativa para gfx1201.
  • Amplia a otimização de permutação Q2_0 do HIP e remove proteções redundantes de disponibilidade.
  • Otimiza o desempacotamento MMQ Q2_0 do HIP usando instruções de permutação nativas.
  • Restaura o tratamento do índice de bloco MMQ e rotula as proteções do pré-processador HIP no código CUDA.

Este lançamento fornece binários para macOS, Linux, Windows, Android e openEuler através de CPU, GPU (CUDA, ROCm, Vulkan, OpenCL) e backends especializados como OpenVINO e SYCL.