Rilis llama.cpp b10614 memperkenalkan perubahan arsitektur signifikan pada backend Metal dengan memisahkan sumber operasi dan mengaktifkan kompilasi paralel. Pembaruan ini juga mencakup beberapa implementasi kernel baru dan dukungan untuk format kuantisasi tambahan.
- Memisahkan metallib menjadi 8 pustaka dan memuatnya secara paralel untuk meningkatkan waktu build.
- Menambahkan op col2im_1d yang mendukung tipe data f32, f16, dan bf16.
- Mengimplementasikan dukungan CONV_2D_DW (konvolusi kedalaman) untuk Metal.
- Menambahkan dukungan format kuantisasi Q2_0.
- Menggabungkan operasi aktivasi snake (mul, sin, sqr, mul, add).
- Memperkenalkan kernel FWHT untuk backend Metal.
Rilis ini menyediakan biner pra-kompilasi untuk macOS, iOS, Linux, Windows, Android, dan openEuler di seluruh CPU, GPU, dan berbagai backend akselerator.