Proyek llama.cpp merilis versi b10840, yang memperkenalkan optimasi kinerja untuk inferensi CUDA. Pembaruan ini mengimplementasikan komputasi tanpa cabang untuk format kuantisasi Q4_K dan Q5_K untuk mempercepat perkalian matriks-vektor (mmvq).

  • Unpacking tanpa cabang mencegah eksekusi ulang skala untuk setiap kolom dalam mmvq, meningkatkan kinerja pada ukuran batch lebih besar dari 1.
  • Logika prefetch L2 dikunci secara khusus untuk perangkat keras DGX Spark untuk memastikan keuntungan terwujud.
  • Pengaman prefetch L2 mmvq diperluas untuk mendukung backend MUSA dan HIP alongside CUDA.
  • Titik switch untuk Q4_K diperbarui untuk mengakomodasi rentang model yang lebih luas.

Perubahan ini memberikan peningkatan kinerja yang terukur bagi pengguna yang menjalankan llama.cpp pada sistem DGX Spark dengan ukuran batch melebihi satu.