A versão b10676 do llama.cpp corrige um bug no `conv_transpose_2d` onde apenas o primeiro lote era computado, deixando os lotes subsequentes como zero. Esta correção se aplica tanto à biblioteca central ggml quanto à implementação do backend Metal.
- ggml: A permutação de origem e o loop de cálculo agora iteram sobre a dimensão do lote, e o tamanho do buffer de trabalho é escalado pela contagem de lotes.
- Metal: A grade do kernel cobre todos os lotes, decodificando o índice do lote a partir da coordenada z para deslocar os índices de entrada e destino.
- Um caso de teste com múltiplos lotes foi adicionado ao `test-backend-ops` para verificar a correção.
Isso garante que os resultados de convolução multi-lote estejam corretos nos backends CPU e GPU.