O projeto llama.cpp lançou a compilação b10750, que reestrutura o gerenciamento das células de chave e valor para melhorar a indexação da posição da sequência e as consultas ao histórico de n-gramas.

  • A função `get_prev_tokens()` foi reconstruída para realizar consultas diretas em vez de percorrer todas as células usadas em cada ubatch.
  • O índice interno agora armazena pares `(pos, cell)` em um `std::set`, permitindo recuperação em tempo logarítmico por meio do novo método `seq_pos_tok_le`.
  • Essa alteração elimina a necessidade da lógica antiga de consulta de janela e fallback de lacuna M-RoPE.
  • Benchmarks no Qwen3.8-Flash-Next UD-Q4_K_XL com contexto de 71k mostram um aumento de 4,9% na velocidade de geração de tokens (de 69,3 para 72,7 t/s) com desempenho de prefill inalterado.

A otimização reduz a sobrecarga computacional durante a inferência, resultando em geração de texto mais rápida para cenários de contexto longo.