El proyecto llama.cpp lanzó la compilación b10181, que incluye una corrección en ggml-cuda para desactivar la Cuantización de Multiplicación Matricial (MMQ) en GPUs con menos de 48 KiB de memoria compartida por bloque. Anteriormente, las configuraciones de MMQ asumían un mínimo de 48 KiB, lo que causaba errores fatales en dispositivos como las GPUs NVIDIA Pascal y Moore Threads MTT S70 donde el tamaño del tile superaba la memoria disponible.

  • La corrección añade una protección en `ggml_cuda_should_use_mmq()` para verificar el presupuesto de memoria compartida antes de seleccionar los tiles de MMQ.
  • Los dispositivos con memoria insuficiente ahora retroceden a la ruta BLAS durante el prefill, evitando core dumps mientras mantienen el rendimiento de generación de tokens.
  • Este cambio se aplica a cualquier dispositivo CUDA que reporte menos de 48 KiB de memoria compartida por bloque, no solo a dispositivos MUSA QY1 específicos.

Esta actualización previene cierres inesperados en hardware antiguo o especializado con memoria compartida limitada, garantizando una inferencia estable mediante el uso automático del backend BLAS compatible.