Proyek llama.cpp merilis build b11059, yang memperkenalkan pembaruan signifikan pada backend Metal untuk perangkat keras Apple Silicon. Perubahan utama adalah penambahan dukungan input F16 ke kernel Transformasi Walsh-Hadamard Cepat (FWHT), memungkinkan pembacaan sumber F16 secara langsung tanpa memerlukan salinan konversi.
- Kernel FWHT Metal sekarang menerima input F16 dengan menjadikan tipe sumber sebagai parameter template, sementara instansiasi F32 tetap tidak berubah.
- Seleksi kupu-kupu tanpa cabang dalam kernel grup SIMD FWHT menggantikan operator ternary, menghasilkan peningkatan kinerja sebesar 3,0% (1285,0 us vs 1324,6 us) pada M5 Pro untuk matmul Hadamard berukuran besar.
Predikat dispatch dipindahkan ke ggml-metal-common untuk memperbaiki build macos-latest-arm64 dan memastikan konsistensi antara supports_op dan logika dispatch.
- Rilis ini mencakup biner untuk macOS, iOS, Linux, Windows, Android, dan openEuler di berbagai backend CPU, CUDA, ROCm, Vulkan, OpenVINO, dan SYCL.
Pembaruan ini meningkatkan efisiensi pada Apple Silicon dengan mengurangi overhead memori dan latensi untuk operasi F16 di backend Metal.