La biblioteca ggml ha optimizado su operación de concatenación reemplazando copias de memoria por elemento con operaciones de memcpy a nivel de fila. Este cambio es parte de la versión b10578 de llama.cpp, que incluye varios binarios específicos de plataforma y actualizaciones al grafo de cálculo subyacente.
- Reemplaza el memcpy por elemento con memcpy a nivel de fila en la operación de concatenación.
- Corrige los desplazamientos de concatenación para el nuevo mecanismo de copia a nivel de fila.
- Añade y mueve las aserciones del tamaño del bloque de concatenación mientras elimina comprobaciones redundantes.
- Proporciona compilaciones para macOS, Linux, Windows, Android y openEuler en CPU, GPU y backends especializados.