O projeto llama.cpp lançou a versão b11335, que inclui uma otimização CUDA para GPUs Volta. A atualização direciona a arquitetura sm_70 para a tabela nwarps existente do Turing MMVQ em vez de cair na configuração genérica.
- Volta (sm_70) agora usa o ajuste TURING para decodificação batch-1 de K-quant, alterando a contagem de warps de 4 para 2.
- Benchmarks em uma Tesla V100 com Qwen3.8-27B mostram um aumento de +3.17% na taxa de transferência (+1.091 t/s) com perplexidade idêntica em nível de bits.
- A mudança é derivada do fork anyei/llamacpp-v100 e se aplica aos seletores de tabela do dispositivo e do host.
Este ajuste melhora a velocidade de inferência no hardware Volta sem afetar a precisão do modelo.