La bibliothèque ggml a optimisé son opération de concaténation en remplaçant les copies mémoire par élément par des opérations de memcpy au niveau des lignes. Ce changement fait partie de la version b10578 de llama.cpp, qui inclut divers binaires spécifiques à la plateforme et des mises à jour du graphe de calcul sous-jacent.

  • Remplace le memcpy par élément par un memcpy au niveau des lignes dans l'opération de concaténation.
  • Corrige les décalages de concaténation pour le nouveau mécanisme de copie au niveau des lignes.
  • Ajoute et déplace les assertions de taille de bloc de concaténation tout en supprimant les vérifications redondantes.
  • Fournit des builds pour macOS, Linux, Windows, Android et openEuler sur CPU, GPU et backends spécialisés.