O projeto llama.cpp lançou a compilação b11272, que inclui otimizações para o backend Hexagon. A mudança principal foca na otimização da operação de concatenação para melhorar o desempenho em hardware Qualcomm Snapdragon.

  • Redução de pacotes no loop crítico de gather/transpose ao coletar diretamente no buffer de destino e usar uma instrução especial para sincronização de gather.
  • Substituição de chamadas de divisão por software por fastdiv para computação mais rápida.
  • Otimização do pipeline DMA-HVX e adição de auxiliares de transposição para a operação de concatenação Hexagon.

Esta atualização fornece binários para macOS, Linux, Windows, Android e openEuler em vários backends de CPU, GPU e NPU.