Proyek llama.cpp merilis versi b10891, yang mengatasi masalah stabilitas kritis pada GPU PowerVR. Pembaruan ini memodifikasi backend Vulkan agar kembali ke reduksi memori bersama untuk operasi perkalian matriks-vektor dekuantisasi (dmmv).

  • Perubahan ini menyelesaikan crash yang disebabkan oleh kompiler Vulkan proprietari Imagination yang mengembalikan VK_ERROR_UNKNOWN saat membangun pipeline komputasi dengan reduksi hanya-subgroup.
  • Perbaikan ini berlaku untuk format kuantisasi k-quants, i-quants, TQ2_0, MXFP4, dan NVFP4 yang sebelumnya gagal pada perangkat seperti Pixel 11 Pro.
  • Varian reduksi memori bersama berhasil dikompilasi dan cocok dengan hasil referensi CPU untuk kuantisasi q2_K hingga q6_K.
  • Varian hibrida juga tersedia tetapi menimbulkan penalti kinerja signifikan, mengurangi throughput token menjadi 27% dari laju standar.

Pembaruan ini memastikan bahwa model yang menggunakan format kuantisasi spesifik ini dapat berjalan pada perangkat keras PowerVR tanpa crash selama fase generasi token awal.