El proyecto llama.cpp lanzó la compilación b10730, que incluye optimizaciones para la arquitectura del modelo Qwen4exp. El cambio principal consiste en sumar las cabezas del indexador por fragmentos en lugar de utilizar una operación de transposición y sum_rows, reduciendo la sobrecarga de copia de memoria.
- La velocidad de procesamiento de prompts aumentó de 2170 a 2366 tokens por segundo en una RTX PRO 6000 con Qwen3.8-Flash-Next UD-Q4_K_XL.
- La optimización elimina los requisitos redundantes de tensores contiguos para la consulta del indexador, ya que rope devuelve un tensor contiguo recién asignado.
- La velocidad de generación permanece sin cambios, pero la ganancia en el procesamiento de prompts escala con la longitud del contexto y el tamaño del ubatch.
- La salida greedy es inalterada token por token en comparación con las versiones anteriores.
Esta actualización mejora la eficiencia para tareas de inferencia de contexto largo que involucran modelos Qwen4exp, al reducir el desperdicio computacional durante la fase de procesamiento de prompts.