La biblioteca ggml ha optimizado su operación de concatenación reemplazando copias de memoria por elemento con operaciones de memcpy a nivel de fila. Este cambio es parte de la versión b10578 de llama.cpp, que incluye varios binarios específicos de plataforma y actualizaciones al grafo de cálculo subyacente.

  • Reemplaza el memcpy por elemento con memcpy a nivel de fila en la operación de concatenación.
  • Corrige los desplazamientos de concatenación para el nuevo mecanismo de copia a nivel de fila.
  • Añade y mueve las aserciones del tamaño del bloque de concatenación mientras elimina comprobaciones redundantes.
  • Proporciona compilaciones para macOS, Linux, Windows, Android y openEuler en CPU, GPU y backends especializados.