Rilis llama.cpp b10831 memperkenalkan dukungan kuantisasi TQ1_0 untuk backend Vulkan, mengaktifkan operasi seperti perkalian matriks, mat-vec, dekuantisasi, dan get_rows. Pembaruan ini juga memperbaiki backend Metal agar menolak operasi TQ1_0 yang tidak didukung dengan benar, memastikan mereka kembali ke eksekusi CPU.

  • Implementasi Vulkan membungkus pangkat 3 TQ1_0 menjadi konstanta 32-bit untuk menghindari masalah register.
  • Helper decode bersama di types.glsl menggantikan logika duplikat di berbagai file shader.
  • Bug dalam perhitungan penyebut workgroup pada shader dekuantisasi mandiri telah diperbaiki.
  • Backend Metal sekarang menolak TQ1_0 untuk GET_ROWS dan mat-mul, sesuai dengan penanganan NVFP4 yang ada.
  • Kasus uji dipangkas dan komentar distandarisasi menjadi ASCII.

Perubahan Vulkan telah diverifikasi di AMD gfx1151 dengan semua operasi backend relevan lulus uji.