O lançamento llama.cpp b11372 introduz otimizações para o índice relâmpago do modelo qwen4exp, principalmente reduzindo pela metade a memória necessária para as pontuações do índice durante o processamento de contexto longo. Isso é alcançado calculando as pontuações das cabeças in situ, em vez de materializar tensores separados para cada cabeça.

  • O índice qwen4exp agora reutiliza buffers do alocador e calcula pontuações via ggml_lightning_indexer para reduzir o uso de memória de pico.
  • Suporte ao backend CUDA adicionado para o índice relâmpago com 4 cabeças, direcionando-as para o kernel vetorial.
  • Backend Metal atualizado para ler a contagem de cabeças a partir de uma constante de função, permitindo que qualquer contagem de cabeças seja executada sem alterações no código.
  • O backend Vulkan fragmenta o índice relâmpago sobre chaves e tokens usando memória compartilhada e produtos escalares fp16.

Essas mudanças melhoram a eficiência de memória para modelos qwen4exp com contextos longos, mantendo o tamanho do buffer de computação e a velocidade.