La versión b10676 de llama.cpp corrige un error en `conv_transpose_2d` donde solo se calculaba el primer lote, dejando los lotes posteriores como cero. Esta corrección se aplica tanto a la biblioteca central ggml como a la implementación del backend Metal.

  • ggml: La permutación de origen y el bucle de cálculo ahora iteran sobre la dimensión del lote, y el tamaño del búfer de trabajo se escala por el conteo de lotes.
  • Metal: La cuadrícula del kernel cubre todos los lotes, decodificando el índice del lote desde la coordenada z para desplazar los índices de entrada y destino.
  • Se añadió un caso de prueba con múltiples lotes a `test-backend-ops` para verificar la corrección.

Esto asegura que los resultados de convolución multi-lote sean correctos en los backends CPU y GPU.