Proyek llama.cpp merilis build b10414, memperkenalkan dukungan untuk jenis kuantisasi ternary GGML_TYPE_TQ2_0 di backend Metal. Pembaruan ini juga mencakup optimasi pada kernel mul_mv tensor kontigu (cont).

  • Menambahkan dukungan GGML_TYPE_TQ2_0 (ternary, 2 bit per elemen) ke backend Metal.
  • Mengoptimalkan kernel mul_mv dengan beralih dari operasi integer ke operasi float.
  • Meningkatkan kinerja melalui jumlah yang dihitung sebelumnya, koefisien yang dipindahkan, dan pemuatan y yang kontigu.

Rilis ini menyediakan biner yang diperbarui untuk macOS, Linux, Windows, Android, dan openEuler di berbagai backend perangkat keras termasuk CPU, CUDA, Vulkan, ROCm, dan SYCL.