O projeto llama.cpp lançou a compilação b10353, que aborda um bug crítico na operação ggml_roll nos backends CUDA e Metal. Anteriormente, tensores fonte permutados (não contíguos) produziam resultados incorretos silenciosamente porque esses backends ignoravam as informações de stride.
- A correção adiciona um requisito de fonte contígua para ambos os kernels roll do CUDA e Metal, correspondendo à proteção GGML_OP_ROPE existente.
- Essa alteração garante que o agendador recorra à implementação da CPU para entradas não contíguas, que lida corretamente com strides.
- Um caso de teste test_roll permutado foi adicionado para verificar a correção.
Esta atualização previne corrupção de dados em modelos que dependem de operações ROLL com layouts de memória não padrão.