Proyek llama.cpp merilis build b10414, memperkenalkan dukungan untuk jenis kuantisasi ternary GGML_TYPE_TQ2_0 di backend Metal. Pembaruan ini juga mencakup optimasi pada kernel mul_mv tensor kontigu (cont).
- Menambahkan dukungan GGML_TYPE_TQ2_0 (ternary, 2 bit per elemen) ke backend Metal.
- Mengoptimalkan kernel mul_mv dengan beralih dari operasi integer ke operasi float.
- Meningkatkan kinerja melalui jumlah yang dihitung sebelumnya, koefisien yang dipindahkan, dan pemuatan y yang kontigu.
Rilis ini menyediakan biner yang diperbarui untuk macOS, Linux, Windows, Android, dan openEuler di berbagai backend perangkat keras termasuk CPU, CUDA, Vulkan, ROCm, dan SYCL.