O lançamento llama.cpp b10089 estende as operações CUDA GET_ROWS para suportar formatos de quantização k-quants, i-quants e mxfp4. Esta alteração garante que todos os tipos GGML quantizados agora podem seguir o caminho direto do dispositivo para buscas de embedding.

  • Adiciona suporte a k-quant (q2_K a q6_K) para lidar com receitas GGUF comuns como Q4_K_M.
  • Estende desquantizadores super-bloco compartilhados para nove i-quants com layout de 32 threads.
  • Move o desquantizador mxfp4 para auxiliares compartilhados, fechando a cobertura de tipos GET_ROWS no CUDA.
  • Controla verificações de tamanho de linha apenas para tipos de sub-bloco de 32 valores (iq4_nl e mxfp4) para evitar fallbacks desnecessários ao host.

Ao impedir que o agendador recue para o host para esses tipos de quantização, a atualização evita copiar toda a matriz de embedding de volta em cada token em gráficos de dispositivo único.