La version b10676 de llama.cpp corrige un bug dans `conv_transpose_2d` où seul le premier lot était calculé, laissant les lots suivants à zéro. Cette correction s'applique à la fois à la bibliothèque centrale ggml et à l'implémentation du backend Metal.
- ggml : La permutation de source et la boucle de calcul itèrent désormais sur la dimension du lot, et la taille du tampon de travail est mise à l'échelle par le nombre de lots.
- Metal : La grille du kernel couvre tous les lots, décodant l'indice du lot depuis la coordonnée z pour décaler les indices d'entrée et de destination.
- Un cas de test multi-lots a été ajouté à `test-backend-ops` pour vérifier la correction.
Cela garantit que les résultats de convolution multi-lots sont corrects sur les backends CPU et GPU.