O projeto llama.cpp lançou a versão b10840, que introduz otimizações de desempenho para inferência em CUDA. A atualização implementa computação sem ramificação para os formatos de quantização Q4_K e Q5_K para acelerar a multiplicação matriz-vetor (mmvq).
- A descompactação sem ramificação evita a reexecução da escala para cada coluna em mmvq, melhorando o desempenho em tamanhos de lote maiores que 1.
- A lógica de prefetch L2 é condicionada especificamente para hardware DGX Spark para garantir que os ganhos sejam realizados.
- O guardiã do prefetch L2 do mmvq é estendida para suportar backends MUSA e HIP junto com CUDA.
- Os pontos de troca para Q4_K são atualizados para acomodar uma faixa mais ampla de modelos.
Essas mudanças fornecem melhorias de desempenho mensuráveis para usuários executando llama.cpp em sistemas DGX Spark com tamanhos de lote superiores a um.