La version b10831 de llama.cpp introduit le support de la quantification TQ1_0 pour le backend Vulkan, permettant des opérations telles que la multiplication matricielle, mat-vec, la déquantification et get_rows. Cette mise à jour corrige également le backend Metal pour refuser correctement les opérations TQ1_0 non prises en charge, garantissant qu'elles basculent vers l'exécution sur CPU.
- L'implémentation Vulkan regroupe les puissances de 3 de TQ1_0 dans une constante 32 bits pour éviter les problèmes de registre.
- Les helpers de décodage partagés dans types.glsl remplacent la logique dupliquée à travers divers fichiers de shader.
- Un bug dans le calcul du dénominateur du groupe de travail du shader de déquantification autonome est corrigé.
- Le backend Metal rejette désormais TQ1_0 pour GET_ROWS et mat-mul, conformément au traitement existant de NVFP4.
- Les cas de test sont réduits et les commentaires standardisés en ASCII.
Les modifications Vulkan ont été vérifiées sur AMD gfx1151 avec toutes les opérations pertinentes du backend passant les tests.