A biblioteca ggml otimizou sua operação de concatenação substituindo cópias de memória por elemento por operações de memcpy em nível de linha. Esta mudança faz parte da versão b10578 do llama.cpp, que inclui vários binários específicos de plataforma e atualizações no grafo de computação subjacente.
- Substitui o memcpy por elemento por memcpy em nível de linha na operação de concatenação.
- Corrige os deslocamentos de concatenação para o novo mecanismo de cópia em nível de linha.
- Adiciona e move as asserções do tamanho do bloco de concatenação enquanto remove verificações redundantes.
- Fornece builds para macOS, Linux, Windows, Android e openEuler em CPU, GPU e backends especializados.