La versión b10831 de llama.cpp introduce soporte de cuantización TQ1_0 para el backend de Vulkan, habilitando operaciones como multiplicación de matrices, mat-vec, dequantización y get_rows. Esta actualización también corrige el backend de Metal para rechazar adecuadamente las operaciones TQ1_0 no compatibles, asegurando que se realicen un fallback a la ejecución en CPU.

  • La implementación de Vulkan agrupa las potencias de 3 de TQ1_0 en una constante de 32 bits para evitar problemas de registros.
  • Los helpers de descodificación compartidos en types.glsl reemplazan la lógica duplicada en varios archivos de shaders.
  • Se corrige un error en el cálculo del denominador del workgroup del shader de dequantización independiente.
  • El backend de Metal ahora rechaza TQ1_0 para GET_ROWS y mat-mul, igualando el manejo existente de NVFP4.
  • Los casos de prueba se han reducido y los comentarios se han estandarizado a ASCII.

Los cambios de Vulkan se han verificado en AMD gfx1151 con todas las operaciones relevantes del backend superando las pruebas.