Proyek llama.cpp telah merilis versi b10739, yang mencakup optimasi kinerja spesifik untuk perangkat keras Apple M2 Max. Pembaruan ini memperkenalkan penyetelan vektor perhatian cepat (fa-vec) yang disesuaikan dengan 30 inti GPU dari M2 Max.
- Menambahkan baris penyetelan fa-vec untuk M2 Max yang dikumpulkan dengan ggml-metal-tuning pada dtypes f16 dan q8_0.
- Menyediakan biner untuk macOS Apple Silicon, Macs Intel, iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android, dan openEuler.
Rilis ini memastikan kinerja inferensi yang dioptimalkan pada Apple silicon terbaru sambil mempertahankan dukungan luas di berbagai sistem operasi dan akselerator perangkat keras.