Rilis llama.cpp b10089 memperluas operasi CUDA GET_ROWS untuk mendukung format kuantisasi k-quants, i-quants, dan mxfp4. Perubahan ini memastikan bahwa semua jenis GGML yang terkuantisasi sekarang dapat mengambil jalur perangkat langsung untuk pencarian embedding.

  • Menambahkan dukungan k-quant (q2_K hingga q6_K) untuk menangani resep GGUF umum seperti Q4_K_M.
  • Memperluas dequantizer super-blok bersama ke sembilan i-quants dengan tata letak 32 utas.
  • Memindahkan dequantizer mxfp4 ke pembantu bersama, menutup cakupan jenis GET_ROWS di CUDA.
  • Mengatur gerbang pemeriksaan ukuran baris hanya untuk jenis sub-blok 32 nilai (iq4_nl dan mxfp4) untuk mencegah fallback host yang tidak perlu.

Dengan mencegah scheduler kembali ke host untuk jenis kuantisasi ini, pembaruan menghindari menyalin seluruh matriks embedding kembali pada setiap token dalam grafik perangkat tunggal.