El proyecto llama.cpp lanzó la compilación b10750, que reestructura la gestión de las celdas de clave y valor para mejorar la indexación de la posición de la secuencia y las búsquedas del historial de n-gramas.

  • La función `get_prev_tokens()` se reconstruyó para realizar búsquedas directas en lugar de recorrer todas las celdas utilizadas en cada ubatch.
  • El índice interno ahora almacena pares `(pos, cell)` en un `std::set`, lo que permite una recuperación en tiempo logarítmico mediante el nuevo método `seq_pos_tok_le`.
  • Este cambio elimina la necesidad de la antigua lógica de búsqueda por ventana y del respaldo para la brecha M-RoPE.
  • Las pruebas de rendimiento sobre Qwen3.8-Flash-Next UD-Q4_K_XL con un contexto de 71k muestran un aumento del 4,9 % en la velocidad de generación de tokens (de 69,3 a 72,7 t/s) con un rendimiento de prellenado sin cambios.

La optimización reduce la sobrecarga computacional durante la inferencia, lo que resulta en una generación de texto más rápida para escenarios de contexto largo.