Pustaka ggml telah mengoptimalkan operasi penggabungan (concat) dengan mengganti salinan memori per-elemen dengan operasi memcpy tingkat baris. Perubahan ini merupakan bagian dari rilis b10578 llama.cpp, yang mencakup berbagai binari spesifik platform dan pembaruan pada grafik komputasi dasar.
- Mengganti memcpy per-elemen dengan memcpy tingkat baris dalam operasi concat.
- Memperbaiki offset concat untuk mekanisme salin tingkat baris yang baru.
- Menambahkan dan memindahkan asersi ukuran blok concat sambil menghapus pemeriksaan redundan.
- Menyediakan build untuk macOS, Linux, Windows, Android, dan openEuler di CPU, GPU, dan backend khusus.