O projeto llama.cpp lançou a versão b11309, que inclui uma otimização chave para o backend do Hexagon. Esta atualização adiciona suporte ao modo scatter seguro à operação ALLREDUCE, visando melhorar o desempenho e a estabilidade em dispositivos Qualcomm Snapdragon.
- Otimiza o ALLREDUCE do Hexagon adicionando suporte ao modo scatter seguro.
- Reescreve a implementação hex-allreduce para remover transbordos de registradores.
- Reduz comentários excessivos no código hex-allreduce.
- Fornece binários para macOS (Apple Silicon e Intel), Linux, Windows, Android e openEuler através dos backends CPU, GPU e NPU.
Este lançamento permite uma inferência distribuída mais eficiente em hardware móvel com NPUs Hexagon, mantendo ampla compatibilidade entre os principais sistemas operacionais de desktop e móveis.