El proyecto llama.cpp lanzó la versión b11335, que incluye una optimización CUDA para GPUs Volta. La actualización dirige la arquitectura sm_70 a la tabla nwarps existente de Turing MMVQ en lugar de caer en la configuración genérica.

  • Volta (sm_70) ahora utiliza el ajuste TURING para la decodificación batch-1 de K-quant, cambiando el número de warps de 4 a 2.
  • Las pruebas en una Tesla V100 con Qwen3.8-27B muestran un aumento del +3.17% en el rendimiento (+1.091 t/s) con una perplejidad idéntica a nivel de bits.
  • El cambio se deriva del fork anyei/llamacpp-v100 y se aplica a los selectores de tabla del dispositivo y del host.

Este ajuste mejora la velocidad de inferencia en hardware Volta sin afectar la precisión del modelo.