El proyecto llama.cpp lanzó la versión b10704, que actualiza el backend de CUDA para usar la ruta optimizada mm_ids_helper para cualquier número de expertos utilizados (n_expert_used). Anteriormente, esta ruta rápida estaba restringida por reglas de divisibilidad del tamaño del warp, obligando a la mayoría de los conteos a retroceder a una implementación genérica más lenta.
- La optimización generaliza el relleno hasta la siguiente potencia de dos, permitiendo casos como n_expert_used = 10 utilizar la ruta rápida.
- Medido en Qwen3.8-Flash-Next con 512 expertos y 10 utilizados a 55k de contexto en una RTX PRO 6000, la velocidad de procesamiento del prompt aumentó de 2334 a 2600 tokens por segundo.
- El rendimiento de generación de tokens permanece sin afectar ya que la optimización se centra en el procesamiento de tokens en lotes.
Este cambio mejora la latencia de inferencia para modelos que utilizan arquitecturas Mixture of Experts al reducir la sobrecarga durante el procesamiento del prompt.