O projeto llama.cpp lançou a compilação b10534, que introduz pontos de troca específicos de hardware para ajustar a transição entre caminhos de vetor e núcleos de tensor durante a decodificação quantizada no CUDA.
- O lançamento adiciona configuração em tempo de execução via GGML_CUDA_MMVQ_MAX para ajustar o limite do tamanho do lote onde o kernel muda de mul_mat_vec_q para MMQ.
- Valores específicos dos pontos de troca agora estão incluídos para as arquiteturas Blackwell, DGX Spark e Ada, reduzindo a dependência de variáveis de ambiente.
- Reduzir esse limite direciona lotes maiores para o caminho do núcleo de tensor int8 MMQ, resultando em um aumento de velocidade medido de 23-41% no tamanho do lote 8 na RTX 5090 para modelos densos Q4_K.
- A atualização inclui binários para macOS, Linux, Windows, Android e openEuler nos backends CPU, CUDA, Vulkan, ROCm, OpenVINO e SYCL.
Esta alteração melhora o desempenho de inferência em GPUs NVIDIA modernas ao selecionar automaticamente o caminho do kernel mais eficiente com base no tamanho do lote e nas capacidades do hardware.