El proyecto llama.cpp ha lanzado la versión b10891, que aborda un problema crítico de estabilidad en las GPU PowerVR. La actualización modifica el backend de Vulkan para recurrir a la reducción por memoria compartida en las operaciones de multiplicación matriz-vectorial desquantizada (dmmv).
- El cambio resuelve un fallo causado por el compilador propietario de Vulkan de Imagination que devolvía VK_ERROR_UNKNOWN al construir pipelines de cómputo con reducciones solo de subgrupo.
- Esta corrección se aplica a los formatos de cuantización k-quants, i-quants, TQ2_0, MXFP4 y NVFP4 que anteriormente fallaban en dispositivos como el Pixel 11 Pro.
- La variante de reducción por memoria compartida compila correctamente y coincide con los resultados de referencia de la CPU para las cuantizaciones q2_K a q6_K.
- También está disponible una variante híbrida, pero implica una penalización significativa en el rendimiento, reduciendo el throughput de tokens al 27% de la tasa estándar.
Esta actualización garantiza que los modelos que utilizan estos formatos de cuantización específicos puedan ejecutarse en hardware PowerVR sin fallar durante la fase inicial de generación de tokens.