O projeto llama.cpp lançou a compilação b10181, que inclui uma correção em ggml-cuda para desativar a Quantização de Multiplicação de Matrizes (MMQ) em GPUs com menos de 48 KiB de memória compartilhada por bloco. Anteriormente, as configurações de MMQ assumiam um mínimo de 48 KiB, causando erros fatais em dispositivos como as GPUs NVIDIA Pascal e Moore Threads MTT S70, onde o tamanho do tile excedia a memória disponível.

  • A correção adiciona uma verificação em `ggml_cuda_should_use_mmq()` para verificar o orçamento de memória compartilhada antes de selecionar os tiles MMQ.
  • Dispositivos com memória insufível agora retornam ao caminho BLAS durante o prefill, evitando core dumps enquanto mantêm o desempenho de geração de tokens.
  • Esta alteração aplica-se a qualquer dispositivo CUDA que reporte menos de 48 KiB de memória compartilhada por bloco, não apenas a dispositivos MUSA QY1 específicos.

Esta atualização evita travamentos em hardware mais antigo ou especializado com memória compartilhada limitada, garantindo inferência estável ao usar automaticamente o backend BLAS compatível.