O projeto llama.cpp lançou a versão b11309, que inclui uma otimização chave para o backend do Hexagon. Esta atualização adiciona suporte ao modo scatter seguro à operação ALLREDUCE, visando melhorar o desempenho e a estabilidade em dispositivos Qualcomm Snapdragon.

  • Otimiza o ALLREDUCE do Hexagon adicionando suporte ao modo scatter seguro.
  • Reescreve a implementação hex-allreduce para remover transbordos de registradores.
  • Reduz comentários excessivos no código hex-allreduce.
  • Fornece binários para macOS (Apple Silicon e Intel), Linux, Windows, Android e openEuler através dos backends CPU, GPU e NPU.

Este lançamento permite uma inferência distribuída mais eficiente em hardware móvel com NPUs Hexagon, mantendo ampla compatibilidade entre os principais sistemas operacionais de desktop e móveis.